跳到正文
10月5日周一
  1. arXiv stat.ML12

    非正则条件下的交叉拟合:基于局部性的正态性与推断

    针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。

  2. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  3. arXiv cs.CL29

    LLM 临床概念中心研究:潜空间中存在可定位、可因果驱动临床行为的表征

    研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。

  4. arXiv cs.CL27

    以文本为中心的后训练实现全模态推理:Qwen2.5-Omni-7B 推理得分提升 25.83%

    针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。

  5. arXiv stat.ML22

    SFT 与 RFT 在分类任务上的对比研究:学习风格,遗忘语义

    一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。

  6. arXiv stat.ML22

    PrO-GPs:面向预测的高斯过程后验

    研究者提出 Predictively Oriented Gaussian Processes(PrO-GPs),将预测不确定性作为首要推断目标,以应对核函数与观测模型选择不当导致的模型误配问题。由于非参数模型的 PrO 后验无法直接计算,作者推导出简化形式与实用采样方案以实现高效计算。合成与真实数据实验显示,在模型误配下 PrO-GPs 的预测分布校准优于标准 GP 方法。

  7. arXiv stat.ML22

    HOST:面向高效高斯 DAG 学习的留出评分算法

    研究者提出 HOST,一种高效高斯 DAG 学习算法,用逐节点留出评分与凸回归替代子集搜索,且无需预先给定入度上界。在合适条件下,HOST 可在多项式时间内以 d log p 量级的样本复杂度精确恢复最大入度为 d 的 p 节点 DAG。实验显示其图恢复效果具竞争力,运行时间扩展性良好。

  8. arXiv cs.LG22

    CLEAN:通过架构隔离实现概念空间扩展下心理测量一致的增量认知诊断

    研究提出增量认知诊断框架 CLEAN,通过严格拓扑二分协议冻结历史诊断函数,并用确定性正交列掩码切断梯度干扰,同时以可扩展满秩分支学习新概念。在三个大规模教育数据集上,CLEAN 实现零 Representation Drift(RD),旧题指标与静态锚点完全一致,新题表现与强持续学习基线相当或更优。

  9. arXiv cs.CV27

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。

  10. arXiv cs.AI22

    强化学习优化核物理散射实验中的靶极化

    研究提出一种结合代理模型与强化学习的控制框架,用于优化核物理实验中的动态极化靶。基于 APOLLO 低温靶系统运行数据,高斯过程回归模型能提供校准的不确定性估计并识别训练分布外区域,MLP 对分布偏移敏感性有限。采用下置信界奖励训练的强化学习智能体,将操作员操作效果提升近 2 倍。

  11. arXiv stat.ML29

    深度表格生成模型在多大训练规模下不再优于平凡基线?一项基于临床与标准数据集规模阶梯的预注册基准测试

    一项预注册基准在 8 个公开数据集(200 至 20,000 训练行)和 4 个原生小型临床数据集上,对 CTGAN、TVAE、TabDDPM 等七种生成器进行了 2,220 次运行。在 24 个(数据集,深度模型)组合中有 23 个,深度模型在任何训练规模下都未超过最佳平凡基线。预注册预测的“小规模下深度模型排名不稳定”被证伪,相邻规模间平均 Kendall tau 为 0.806。

  12. arXiv stat.ML13

    高维渐近理论与隐私迁移学习的数据集选择

    研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。

  13. arXiv cs.CL27

    TPBench:面向对话压缩的转折点基准

    研究者提出 TPBench,用于评估对话压缩中的"转折点驱逐"失败:压缩器可能保留事实却丢掉改变事实的那一轮对话。TPBench 在相同名义保留预算下评测三个信息目标,P1 为用户初始目标,P2 为用户修改后槽位的当前值,P3 为两者兼有,答案取自 MultiWOZ 与 SGD 的人工对话状态标注。

  14. arXiv cs.LG20

    Co-design Gym:面向具身与策略协同优化的统一基准

    研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。

  15. arXiv cs.LG29

    LINEUP:将个性化与逐用户适配解耦,每个用户只需优化 8 个标量

    LINEUP 将个性化能力与逐用户可训练状态解耦,每个目标用户只需优化 8 个标量,而对比的 private-LoRA 配置每用户需 419 万参数。该方法学习一组可复用的低秩个性化因子,通过用户条件召回与查询相关校准组合,并把目标用户适配限制在共享修正空间上的极小用户编码中。

  16. arXiv cs.CV12

    4DFEID:4D 面部表情强度数据集发布

    研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。

  17. arXiv stat.ML13

    ResTGP:面向高维数据的残差树高斯过程建模框架

    研究者提出贝叶斯残差树高斯过程方法 ResTGP,用于处理多维域中具有异质结构的大规模空间数据。该方法沿二进树在多个分辨率上迭代分解预测过程与残差过程,实现灵活的多尺度协方差建模与分治计算,并基于递归消息传递的贝叶斯推断策略使计算量在给定树下随样本量线性增长。论文还证明了非参数回归框架下连续函数估计的后验一致性,数值实验与风暴潮应用验证了其优势。

  18. arXiv cs.AI31

    AI Risk Observatory:用 LLM 分析英国上市公司年报中的 AI 风险披露

    研究用两阶段分类流水线处理 1,362 家英国上市公司 2020-2025 年的 9,821 份年报,发现提及 AI 风险的报告占比从 2.8% 升至 41.2%,AI 采用披露从 13.8% 升至 45.2%,供应商提及集中在以 Microsoft 为首的少数厂商。2025 年 41.2% 的报告提及 AI 风险,但仅 4.3% 属于实质性披露,危害披露全语料仅 7 份。

  19. arXiv cs.LG20

    固定目标异常检测器的收敛坍缩问题:用核锚定局部性正则化(KAR)缓解

    研究揭示固定目标异常检测器存在"收敛坍缩":优化越好、检测越差,因收敛后残差信号在异常与正常数据上同时消失。作者提出闭式、免训练、CPU 高效的 Kernel Contraction Matching(KCM),并在此基础上引入 Kernel-Anchored Regularizer(KAR),惩罚神经预测偏离训练目标的核加权平均。