跳到正文
今天10月7日周三76 条
  1. arXiv cs.CV24

    SRIM:面向恶意编辑的尺度鲁棒图像免疫保护扰动方法

    针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。

  2. arXiv cs.CV18

    SimCortex v2:近乎零碰撞与自交的联合皮层表面重建

    SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。

  3. arXiv cs.CV22

    LAO-X:无需人工标注即可定位 X 光安检扫描中的任意物体

    研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。

  4. arXiv cs.CV12

    面向可泛化小样本类增量学习:学习筛选你生成的数据

    研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。

  5. arXiv cs.CV24

    超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型

    针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。

  6. arXiv cs.LG18

    通过路径-流对齐实现路径与流的协同演化

    研究提出路径-流对齐作为 flow matching 的统一训练目标,联合训练保端点的路径网络与流网络,使流匹配路径速度、路径对齐当前流。作者发现路径过拟合:对齐损失下降但样本质量变差,与概率路径中的低熵瓶颈有关。为此引入随机路径正则化器,隐藏部分源信息并保持端点精确,在 ImageNet-256x256 与 SiT 骨干上跨模型规模持续改善 FID。

  7. arXiv cs.LG12

    Learned AMDI:用强化学习策略替代固定选择器的自适应多分辨率扩散成像

    Learned AMDI 保留 AMDI 固定树传播器与层级约束,用 proximal policy optimization 训练的共享局部策略替换传播后选择器。在九个留出案例中,它执行 393 次细化,将平均终端参考差异从 0.17496 降至 0.13657,占用率从 0.13737 升至 0.26660。该共享 actor 无需重训练即可迁移到 64×64 和 128×128 图像。

  8. arXiv cs.LG31

    VAE 潜在空间中的颜色对齐及其应用:从 SD1.5 到 FLUX.2 的跨模型颜色子空间研究

    研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。

  9. arXiv cs.LG24

    什么是 Fréchet 距离?一种方向性分解方法

    研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。

  10. arXiv cs.LG26

    研究揭示基于潜空间的水印方法固有鲁棒性局限

    针对扩散模型的潜空间水印方法,一项理论分析首次解释了这类方法为何对旋转、缩放、平移等图像扰动缺乏不变性,并推导出刻画像素空间扰动与潜空间响应关系的最大扰动界。研究还首次给出覆盖实际检测机制各组件的解析形式,实验验证了理论结论:在当前设计范式下,基于潜空间的水印方法固有地表现出有限鲁棒性。

  11. arXiv cs.LG22

    Global Transport:面向无分类器引导流模型的全局传输耦合

    研究者提出 Global Transport(GT),一种不依赖类别标签的全局类别无关最优传输耦合,用于条件流模型的训练。GT 单独使用会因将不同条件关联到源噪声不同区域而降低性能,但与无分类器引导(CFG)结合后,在离散类别和连续文本条件的图像生成中,跨模型规模和采样预算均稳定提升生成效果。该结果表明耦合设计应在推理时的引导流下评估,可作为无需改动架构、采样器或引导机制的训练期优化手段。

  12. arXiv cs.AI26

    BoNG:面向测试时扩散模型对齐的 Best-of-N 引导方法

    研究者提出 Best-of-N Guidance(BoNG),将 BoN 采样直接融入反向扩散过程,通过去噪粒子间的非对称引导交互,把粒子群导向更高奖励区域。在 36 项对比中 BoNG 有 29 项表现最佳,对 SMC 和 Vanilla BoN 的胜率达 80.56%。该方法支持多输出,ImageReward 分数为最新基于采样的引导方法的 1.3 倍,速度提升 1.6 倍,代码已开源。

  13. arXiv cs.AI22

    多尺度结构特征助力持续、可理解的视觉识别:一种发展式学习框架

    研究者提出一种多尺度视觉特征表示,将边缘与轮廓特征及其空间关系编码后,集成进无梯度的发展式学习框架,在类增量 MNIST 上大幅提升识别准确率。该方法无需回放缓冲区或预设任务边界,存储量相当时可匹配或超越基于回放与正则化的基线,且不遗忘旧类别。学到的表示保持人类可解释性,基线方法则在训练周期内丢失大部分刚学类别后再重新学习。

  14. arXiv cs.AI22

    D3S2:面向语义分割的扩散引导数据集蒸馏框架

    D3S2 是面向语义分割的扩散引导数据集蒸馏框架,采用类平衡掩码选择与扩散引导图像合成两阶段设计,通过分割一致性损失和类级特征匹配损失提升合成数据训练效用。在 1% 压缩率下,该方法在 ADE20K 和 COCO-Stuff 上以 Mask2Former(Swin-S)分别达到 24.99% 和 35.49% mIoU,较随机选择高出 9.34% 和 5.70%。代码已开源。

  15. arXiv cs.AI20

    FSCE:面向抗噪 SAR ATR 的目标感知频率-空间协同增强框架

    研究者提出目标感知频率-空间协同增强(FSCE)框架,用于抗噪 SAR ATR,通过频率-空间建模实现早期特征稳定并结合语义正则化。该框架在网络入口设计 FS-EAE 模块抑制噪声传播,并引入 APSA 机制以在线教师策略施加语义约束。在 MSTAR、OpenSARShip 和 FUSARShip 上的实验验证了其有效性,轻量版 FSCE-Net_μ 仅 0.17M 参数。

  16. arXiv cs.AI20

    Dual-FDM:在频率感知扩散模型中解耦双重图像参考的个性化生成

    研究者提出 Dual-FDM,一种在频率感知扩散模型中解耦双重图像参考的个性化生成范式,可同时处理定制风格迁移与色彩风格迁移。该方法通过掩码策略在频域解耦不同频段:定制风格迁移用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移则用色彩参考前景与背景的低频段替换风格参考背景的低频段。实验验证其优于当前最先进的个性化图像生成扩散模型,代码已公开,论文将发表于 NeurIPS 2026。

  17. arXiv cs.AI24

    ElasticFit:基于 VLM 推理与生成式适配的贴合感知 3D 物体插入

    ElasticFit 是一个 VLM 引导的贴合感知 3D 物体插入框架,通过场景锚定的结构化拟合线索,将 VLM 推理转化为显式 3D 约束,支持刚性放置、等比缩放和弹性贴合三种适配模式。在固定资产基线对比中,其空间关系成功率从 50.8% 提升至 69.7%,支撑成功率从 48.3% 提升至 91.7%。该工作已被 NeurIPS 2026 接收。

  18. arXiv cs.AI17

    WildMatch:面向野生动物重识别的弱监督图像匹配器适配方法

    WildMatch 提出一种仅用身份标签的弱监督方法,将预训练关键点匹配器适配到野生动物重识别任务,无需关键点级或几何对应标注。该方法用预训练匹配器挖掘图像对,从身份一致性导出弱正负监督,对比微调匹配网络以增强同身份对应、抑制异身份对应。在多个开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。

  19. arXiv cs.AI22

    Anchor and Adapt:面向少样本工业异常检测的非对称提示词自适应框架

    研究者提出 Anchor and Adapt 两阶段提示词学习框架,将异常语义获取与目标正常外观适配分离:Stage I 从带标注辅助数据学习可迁移的正常与异常锚点,Stage II 固定锚点并用少量目标正常样本适配额外正常分支。在 MVTec-AD 与 VisA 跨数据集 1-shot、2-shot、4-shot 设置下,该框架取得有竞争力的检测与定位性能,且无需合成异常生成。

  20. arXiv cs.AI13

    能量条件化噪声调度与白化:面向频谱扩散模型的新方法

    该研究提出一种能量自适应噪声调度与白化策略,将全局频谱白化与能量条件化噪声分配结合,根据各变换系数的能量及图像相关的能量路径联合调制注入噪声,同时保持高斯转移与闭式边缘分布,兼容标准 DDPM 和 DDIM 流程。在 CIFAR-10 上,该方法将紧凑型 DCTdiff U-Net 变体的 FID 从 142.48 降至 100.45。

10月5日周一
  1. arXiv stat.ML22

    ENCORE:用副本交换实现扩散生成精确非平衡控制

    研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。