跳到正文
今天10月7日周三1093 条
  1. arXiv cs.CV13

    面向噪声参与度识别的机器遗忘:按主体移除有害数据

    研究将主体级机器遗忘用作参与度识别的后处理净化机制:在已训练模型上排序有害主体并做轻量近似遗忘更新,无需完整重训。在 DAiSEE 和 EngageNet 上以 TCCT-Net 为固定平台,K=3 遗忘集设置下分别恢复 oracle 增益的 92.5% 和 89.3%,成本约为重训的四分之一。效果在中等遗忘集规模时最强,依赖主体选择质量与移除机制。

  2. arXiv cs.CV22

    面向 3D Gaussian Splatting 的场景无关物体中心表示学习

    研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。

  3. arXiv cs.CV18

    AdaRAG-CT:自适应检索增强的 3D CT 报告生成框架

    针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。

  4. arXiv cs.CV27

    Cultural Counterfactuals:用反事实样本评估大型视觉语言模型的文化偏见

    研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。

  5. arXiv cs.CV24

    MedVAR:面向多解剖区域医学图像生成的可扩展下一尺度自回归模型

    MedVAR 是首个通过自回归训练实现全方位医学图像生成的基础模型,在 40 个数据集共 438,905 张切片上训练,覆盖 CT 和 MRI 的六个解剖区域,生成速度比 100 步扩散基线快 12-19 倍。生成质量随模型规模提升,用其生成图像预训练可将七中心肝细胞癌分割 Dice 从 0.615 提升至 0.632。

  6. arXiv cs.CV22

    REPA-G:用表征对齐视觉特征实现测试时条件控制

    研究者提出 REPA-G(Representation-Aligned Guidance),一种在推理阶段利用自监督模型对齐表征进行条件控制的框架,无需额外训练即可引导扩散模型去噪过程。该方法支持从单 patch 匹配到全局图像特征 token 的多粒度控制,并可扩展至多概念组合,在 ImageNet 和 COCO 上生成高质量且多样的结果。

  7. arXiv cs.CV24

    InStyle:3D 形状的即时外观风格化

    研究提出 GaussianBlender,一个前馈式文本驱动 3D 风格化框架,可在推理时即时完成编辑。该方法从空间分组的 3D Gaussian 中学习几何与外观解耦的隐空间,再用潜在扩散模型施加文本条件编辑。评估显示其风格化即时、高保真、保持几何且多视角一致,并超越需逐实例测试时优化的方法。

  8. arXiv cs.CV33

    深度伪造检测的缩放定律研究:ScaleDF 数据集与幂律规律

    研究系统分析了深度伪造检测中的缩放定律,发现检测平均误差随真实图像域数量或伪造生成方法数量增加呈可预测的幂律衰减,类似大语言模型的缩放规律。为此构建了 ScaleDF 数据集,包含来自 51 个数据集的超 580 万张真实图像和 102 种方法生成的超 880 万张伪造图像。该规律可用于预测达到目标性能所需的额外域或方法数量,并以数据为中心应对不断演进的深度伪造技术。

  9. arXiv cs.CV22

    用引导扩散模型分析 DNN 特征空间

    研究者提出一种引导扩散模型解码器,可生成特征与用户指定特征高度匹配的图像,从而精确分析视觉 DNN 的特征空间。该方法无需训练即可分析不同 DNN,且可在单块商用 GPU 上运行,在 CLIP 图像编码器和 ResNet-50 上的实验验证了其有效性。代码与数据已公开。

  10. arXiv cs.CV22

    重新审视视觉溯源:直接视觉生成与 LLM 驱动代码渲染中的检测与水印

    一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。

  11. arXiv cs.CV22

    VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 剪枝

    VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。

  12. arXiv cs.CV24

    UltraDiff:面向超声形状优化的可微光线追踪框架

    UltraDiff 将可微渲染范式扩展到医学超声,把超声成像建模为以飞行时间门控的路径空间积分,并推导出前向模型及场景参数梯度的 Monte Carlo 估计器。该框架基于 Mitsuba 3 实现,在逆几何估计任务中从球体出发优化 SDF,可从模拟 B 超扫查和真实脊柱体模机器人采集中恢复椎体表面,无需预分割图像即可在 B 超图像上无监督完成,几何精度与当前最优方法相当。

  13. arXiv cs.CV30

    ROMA:面向真实世界物体中心多感官主动感知的 LLM 系统

    ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。

  14. arXiv cs.CV30

    视频世界模型的物理一致性基准:World Models' Last Exam in Physics

    研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。

  15. arXiv cs.CV29

    从单张图像构建罗马:Trellis 2 改造实现室内外场景 3D 重建

    研究者提出一种方法,将 Trellis 2 等以物体为中心的 3D 生成器改造为可处理室内外场景的单图 3D 重建。方法通过按相机距离自适应分块、建立显式 2D-3D 对应关系,并合成约 4,000 个室外场景扩充训练数据。在 Tanks and Temples、ScanNet++ 及真实图像上,该方法在几何精度和感知质量上均优于所有基线。

  16. arXiv cs.CV26

    ALIVE:面向首帧引导视频编辑的交互对齐物体插入框架

    ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。

  17. arXiv cs.CV27

    BASA:面向快速高分辨率视觉生成的后端无关稀疏注意力

    研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。

  18. arXiv cs.CV22

    基于 Patch 的高光谱图像分类中的数据泄漏:量化空间重叠的影响

    研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。

  19. arXiv cs.CV27

    SpaTime:面向时空推理的流式视觉语言模型

    SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。

  20. arXiv cs.CV22

    视频多选评测中的帧相位与选项顺序:Stable Scores, Unstable Answers

    视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。

  21. arXiv cs.CV22

    基于基础模型引导扩散的 LiDAR 分辨率恢复

    研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。

  22. arXiv cs.CV22

    RSJEV:用多模态大语言模型做判别式遥感场景分类

    针对遥感场景分类,研究者提出 RSJEV,将分类重构为候选类别条件下的多模态判别式决策过程,用 OnePass Decider 直接估计类别概率,省去自回归解码。在 UC Merced、AID、NWPU-RESISC45 三个基准上,RSJEV 性能优于代表性 CNN、Transformer、Mamba、CLIP 和 MLLM 方法,并以仅 0.8B 参数模型显著降低推理成本。代码将公开。