跳到正文
10月5日周一
  1. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  2. arXiv cs.LG12

    重尾噪声下无需参数的区间动态遗憾界

    研究在每轮仅有一个无偏随机次梯度、且条件 p 阶噪声矩未知(1<p≤2)的在线凸优化中,提出一种无需知道 G、σ、p、I、P_I 的算法,对任意长度 n 的固定区间 I 取得区间动态遗憾上界,同时保留均值梯度与噪声各自的指数项。该分析在期望层面控制校准,其一般定理与基于非均匀先验的相对熵专家分布相比较,在给定统计量下区间代价为 1+log(T/n),并包含最优的全时域静态速率。

  3. arXiv cs.AI22

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    研究者提出 HXAI,一个在分布式能源系统中兼顾隐私与可解释性的分层框架,由本地模型在安全环境内生成细粒度解释、区域模型聚合解释以支持电网级分析两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟和真实能源数据集上实现了区域负载管理的有用洞察,同时家电级用电数据始终保留在本地、不传输给电网运营商。

  4. arXiv cs.CL29

    LLM 临床概念中心研究:潜空间中存在可定位、可因果驱动临床行为的表征

    研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。

  5. arXiv cs.CV23

    Spatial Memory Intelligence:用理解模型为世界模型赋予长期空间记忆

    研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架。SMI 包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项协同原子操作,在多个基线、benchmark 和世界模型骨干上实现了记忆稀疏度、生成稳定性与空间一致性的全面提升。

  6. arXiv cs.CL27

    以文本为中心的后训练实现全模态推理:Qwen2.5-Omni-7B 推理得分提升 25.83%

    针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。

  7. arXiv stat.ML22

    SFT 与 RFT 在分类任务上的对比研究:学习风格,遗忘语义

    一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。

  8. arXiv cs.CV27

    多模态大模型为何"看得见却说得出用不上":SpaceConflict 基准与 OSS 监督方法

    多模态大模型能正确报告空间事实,却未必在后续推理中使用该事实。研究者提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 局部事实绑定到 L4 变换下状态判断四个层级,揭示"可用性—利用率"鸿沟:Qwen3.5-9B 在 100 条正确恢复初始状态的序列中有 50 条无法完成完整变换,显式提供状态可修复全部 50 条。

  9. arXiv cs.LG22

    MACTS-EM:多智能体协作时间序列预测框架,引入涌现记忆机制

    研究者提出 MACTS-EM 多智能体协作时间序列预测框架,通过领域专用预测智能体、元认知层动态分配、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件协同工作。在金融市场、气候模式、能源消耗和疫情传播等场景评测中,该框架预测准确率提升 8-12%,零样本迁移能力提升 22-27%,regime shifts 期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。

  10. arXiv cs.AI22

    研究:英国医护人员对机器翻译风险认知不足,Google Translate 翻译医学缩写成隐患

    英国医护人员常依赖 Google Translate 与患者沟通,但一项针对 21 名不同岗位医护人员的访谈研究显示,他们对机器翻译在医疗场景中的风险认知有限。研究以医学缩写为用例,将临床语料库中的法语和西班牙语数据经 Google Translate 翻译后展示给受访者,发现此类高风险翻译可能危及患者安全。

  11. arXiv stat.ML18

    一致性模型多步采样理论:稳定性、误差界与噪声调度

    针对一致性模型(CM)多步采样中步数对样本质量影响难以解释的问题,研究者将多步 CM 采样建模为加噪与近似去噪算子的复合,在可验证的稳定性假设下推导出非渐近误差界,将初始化误差的收缩与近似误差的累积分离。该误差界表明:早期大噪声水平驱动收缩,后期小噪声水平控制残余偏差;对强对数凹与半对数凹目标还给出显式常数。实验显示误差界中的收缩与近似曲线可被可靠测量,并与预测的函数形式吻合。

  12. arXiv stat.ML24

    GTDD:面向 AI 编程智能体的生成式测试驱动开发与对抗测试

    研究者提出生成式测试驱动开发(GTDD),由独立的测试智能体在每次候选实现固定后,依据人类指定的行为契约与历史反馈生成新输入,可信评估器校验并返回精简反例供回归测试。在有状态键值存储的配对实验中,开发过程中重新生成测试的策略平均失败率低于仅用同一语言模型一次性生成测试的策略,而向测试方提供候选源码未带来可检测的额外提升。

  13. arXiv stat.ML22

    PrO-GPs:面向预测的高斯过程后验

    研究者提出 Predictively Oriented Gaussian Processes(PrO-GPs),将预测不确定性作为首要推断目标,以应对核函数与观测模型选择不当导致的模型误配问题。由于非参数模型的 PrO 后验无法直接计算,作者推导出简化形式与实用采样方案以实现高效计算。合成与真实数据实验显示,在模型误配下 PrO-GPs 的预测分布校准优于标准 GP 方法。

  14. arXiv stat.ML22

    HOST:面向高效高斯 DAG 学习的留出评分算法

    研究者提出 HOST,一种高效高斯 DAG 学习算法,用逐节点留出评分与凸回归替代子集搜索,且无需预先给定入度上界。在合适条件下,HOST 可在多项式时间内以 d log p 量级的样本复杂度精确恢复最大入度为 d 的 p 节点 DAG。实验显示其图恢复效果具竞争力,运行时间扩展性良好。

  15. arXiv cs.LG22

    用大语言模型克服解释结构建模(ISM)的挑战

    研究探索用 LLM 作为"不完美专家"完成解释结构建模(ISM)中的因果图发现,以替代传统依赖专家反复交互的方式。对比成对、k-wise、逐行和全图四种方法后,逐行法(SHD=160,F1-score=0.77)与全图法(SHD=135,F1-score=0.73)表现最佳。该集成 LLM-ISM 路径有望让 ISM 扩展到含数百个变量的研究。

  16. arXiv cs.CL22

    研究评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则的 VQA 任务中的表现

    一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。

  17. arXiv cs.LG22

    CLEAN:通过架构隔离实现概念空间扩展下心理测量一致的增量认知诊断

    研究提出增量认知诊断框架 CLEAN,通过严格拓扑二分协议冻结历史诊断函数,并用确定性正交列掩码切断梯度干扰,同时以可扩展满秩分支学习新概念。在三个大规模教育数据集上,CLEAN 实现零 Representation Drift(RD),旧题指标与静态锚点完全一致,新题表现与强持续学习基线相当或更优。

  18. arXiv cs.CV27

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。

  19. arXiv cs.AI32

    ProWAM:渐进式视觉规划的世界动作模型,在 LIBERO-Plus 与 RoboTwin 刷新 SOTA

    ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上达到 75.7%,相对最强基线提升最高 +35.9%;零样本真实场景成功率为 70.0%,较基线 55.0% 提升 +15.0。