跳到正文
10月5日周一
  1. arXiv cs.CV24

    SCOPE-4D:内窥镜 4D 几何基础模型

    SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。

  2. arXiv cs.LG22

    SF-MOPD:慢-快多教师在线策略蒸馏如何缓解能力干扰

    研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。

  3. arXiv cs.CV24

    基于仿真的智能体 VLM 框架用于野火监测与报告

    研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。

  4. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  5. arXiv cs.CV23

    Spatial Memory Intelligence:用理解模型为世界模型赋予长期空间记忆

    研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架。SMI 包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项协同原子操作,在多个基线、benchmark 和世界模型骨干上实现了记忆稀疏度、生成稳定性与空间一致性的全面提升。

  6. arXiv cs.CL27

    以文本为中心的后训练实现全模态推理:Qwen2.5-Omni-7B 推理得分提升 25.83%

    针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。

  7. arXiv cs.CV27

    多模态大模型为何"看得见却说得出用不上":SpaceConflict 基准与 OSS 监督方法

    多模态大模型能正确报告空间事实,却未必在后续推理中使用该事实。研究者提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 局部事实绑定到 L4 变换下状态判断四个层级,揭示"可用性—利用率"鸿沟:Qwen3.5-9B 在 100 条正确恢复初始状态的序列中有 50 条无法完成完整变换,显式提供状态可修复全部 50 条。

  8. arXiv cs.CL22

    研究评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则的 VQA 任务中的表现

    一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。

  9. arXiv cs.CV27

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。

  10. arXiv cs.AI32

    ProWAM:渐进式视觉规划的世界动作模型,在 LIBERO-Plus 与 RoboTwin 刷新 SOTA

    ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上达到 75.7%,相对最强基线提升最高 +35.9%;零样本真实场景成功率为 70.0%,较基线 55.0% 提升 +15.0。

  11. arXiv cs.CV12

    4DFEID:4D 面部表情强度数据集发布

    研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。

  12. arXiv cs.CL17

    多模态声明验证对 LLM 改写有多鲁棒?

    研究测试了 11 个开源权重模型(覆盖 5 个 VLM 家族、2B 至 38B 参数)在多模态声明验证任务中对 LLM 改写的鲁棒性。结果显示多数模型准确率无显著下降,但概率出现一致性偏移:对冲类改写几乎在所有模型上引发显著偏移,增强类效果较弱,语法纠错等常规润色几乎无影响。

  13. arXiv cs.CV24

    MeshQuery:用智能体做 UV 展开的接缝规划

    MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。

  14. arXiv cs.CV22

    SymRegFlow:面向视频世界模型的对称正则化流匹配

    SymRegFlow 是一个对称正则化流匹配框架,可在无新视角 RGB 真值监督的情况下,实现连续视角下的多视角一致视频生成。该方法通过几何变换将源视图转为带噪锚点,结合掩码双锚点监督与跨锚点去噪输出一致性来抑制锚点误差,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优解。

8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。