跳到正文
10月5日周一
  1. arXiv stat.ML22

    PrO-GPs:面向预测的高斯过程后验

    研究者提出 Predictively Oriented Gaussian Processes(PrO-GPs),将预测不确定性作为首要推断目标,以应对核函数与观测模型选择不当导致的模型误配问题。由于非参数模型的 PrO 后验无法直接计算,作者推导出简化形式与实用采样方案以实现高效计算。合成与真实数据实验显示,在模型误配下 PrO-GPs 的预测分布校准优于标准 GP 方法。

  2. arXiv stat.ML22

    HOST:面向高效高斯 DAG 学习的留出评分算法

    研究者提出 HOST,一种高效高斯 DAG 学习算法,用逐节点留出评分与凸回归替代子集搜索,且无需预先给定入度上界。在合适条件下,HOST 可在多项式时间内以 d log p 量级的样本复杂度精确恢复最大入度为 d 的 p 节点 DAG。实验显示其图恢复效果具竞争力,运行时间扩展性良好。

  3. arXiv cs.LG22

    用大语言模型克服解释结构建模(ISM)的挑战

    研究探索用 LLM 作为"不完美专家"完成解释结构建模(ISM)中的因果图发现,以替代传统依赖专家反复交互的方式。对比成对、k-wise、逐行和全图四种方法后,逐行法(SHD=160,F1-score=0.77)与全图法(SHD=135,F1-score=0.73)表现最佳。该集成 LLM-ISM 路径有望让 ISM 扩展到含数百个变量的研究。

  4. arXiv cs.CL22

    研究评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则的 VQA 任务中的表现

    一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。

  5. arXiv cs.LG22

    CLEAN:通过架构隔离实现概念空间扩展下心理测量一致的增量认知诊断

    研究提出增量认知诊断框架 CLEAN,通过严格拓扑二分协议冻结历史诊断函数,并用确定性正交列掩码切断梯度干扰,同时以可扩展满秩分支学习新概念。在三个大规模教育数据集上,CLEAN 实现零 Representation Drift(RD),旧题指标与静态锚点完全一致,新题表现与强持续学习基线相当或更优。

  6. arXiv cs.CV27

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。

  7. arXiv cs.AI32

    ProWAM:渐进式视觉规划的世界动作模型,在 LIBERO-Plus 与 RoboTwin 刷新 SOTA

    ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上达到 75.7%,相对最强基线提升最高 +35.9%;零样本真实场景成功率为 70.0%,较基线 55.0% 提升 +15.0。

  8. arXiv cs.AI22

    强化学习优化核物理散射实验中的靶极化

    研究提出一种结合代理模型与强化学习的控制框架,用于优化核物理实验中的动态极化靶。基于 APOLLO 低温靶系统运行数据,高斯过程回归模型能提供校准的不确定性估计并识别训练分布外区域,MLP 对分布偏移敏感性有限。采用下置信界奖励训练的强化学习智能体,将操作员操作效果提升近 2 倍。

  9. arXiv cs.CL22

    超越分数对齐:LLM-as-a-Judge 残余评判难度的心理测量学分析

    研究从心理测量学视角分析 LLM-as-a-Judge,对人工与 LLM 评分分别拟合 Many-Facet Rasch 模型,提出"残余难度"指标以衡量评判难度。在 SummEval 上测试 17 个开源权重 LLM 评委发现,潜在摘要质量的中等对齐并不意味着残余难度对齐,且这种不匹配强烈依赖评估维度:一致性维度偏向 LLM 更难,连贯性维度偏向人类更难。

  10. arXiv stat.ML29

    深度表格生成模型在多大训练规模下不再优于平凡基线?一项基于临床与标准数据集规模阶梯的预注册基准测试

    一项预注册基准在 8 个公开数据集(200 至 20,000 训练行)和 4 个原生小型临床数据集上,对 CTGAN、TVAE、TabDDPM 等七种生成器进行了 2,220 次运行。在 24 个(数据集,深度模型)组合中有 23 个,深度模型在任何训练规模下都未超过最佳平凡基线。预注册预测的“小规模下深度模型排名不稳定”被证伪,相邻规模间平均 Kendall tau 为 0.806。

  11. arXiv stat.ML13

    1-Bit 反馈下的近最优固定置信度最佳臂识别

    研究在严格 1-bit 反馈约束下的固定置信度最佳臂识别问题,学习者每轮只能收到一个比特,判断采样奖励是否属于所选查询集。作者提出基于随机阈值查询与截断尾积分恒等式的时间一致 1-bit 均值估计原语,并嵌入候选-挑战者算法:固定截断版本给出 anytime (ε,δ)-PAC 保证,分阶段自适应截断版本实现间隙自适应样本复杂度。

  12. arXiv stat.ML13

    高维渐近理论与隐私迁移学习的数据集选择

    研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。

  13. arXiv cs.CL27

    TPBench:面向对话压缩的转折点基准

    研究者提出 TPBench,用于评估对话压缩中的"转折点驱逐"失败:压缩器可能保留事实却丢掉改变事实的那一轮对话。TPBench 在相同名义保留预算下评测三个信息目标,P1 为用户初始目标,P2 为用户修改后槽位的当前值,P3 为两者兼有,答案取自 MultiWOZ 与 SGD 的人工对话状态标注。

  14. arXiv cs.LG20

    Co-design Gym:面向具身与策略协同优化的统一基准

    研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。

  15. arXiv cs.LG20

    不同假设下 MS/MS 谱图分子指纹预测的最近邻基线

    针对 MS/MS 谱图预测分子指纹,最近邻检索已被证明是强基线,多种变体可匹敌或超越当前深度学习模型。该报告系统比较了在推理阶段假设可用信息不同的多种最近邻变体,展示这些假设如何影响性能,目标是建立更严格的基线以支持更严谨的基准测试并更好衡量该领域进展。

  16. arXiv cs.LG29

    LINEUP:将个性化与逐用户适配解耦,每个用户只需优化 8 个标量

    LINEUP 将个性化能力与逐用户可训练状态解耦,每个目标用户只需优化 8 个标量,而对比的 private-LoRA 配置每用户需 419 万参数。该方法学习一组可复用的低秩个性化因子,通过用户条件召回与查询相关校准组合,并把目标用户适配限制在共享修正空间上的极小用户编码中。

  17. arXiv cs.CL22

    WakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略

    WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。

  18. arXiv cs.CV12

    4DFEID:4D 面部表情强度数据集发布

    研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。

  19. arXiv cs.CL17

    多模态声明验证对 LLM 改写有多鲁棒?

    研究测试了 11 个开源权重模型(覆盖 5 个 VLM 家族、2B 至 38B 参数)在多模态声明验证任务中对 LLM 改写的鲁棒性。结果显示多数模型准确率无显著下降,但概率出现一致性偏移:对冲类改写几乎在所有模型上引发显著偏移,增强类效果较弱,语法纠错等常规润色几乎无影响。

  20. arXiv stat.ML29

    AREX:面向 Flow Matching 少步采样的仿射残差指数积分器

    AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。

  21. arXiv cs.CV30

    SCION:用实例化神经基元实现场景组合

    SCION 是一种分层组合式场景表示,用可复用基元的紧凑词表加轻量级世界空间实例替代独立高斯,通过离散与连续场景参数的联合优化拟合多视图捕捉,在 1.2 MB 下仍保持高质量。它取得优于现有高斯压缩方法的率失真表现,并支持无需重训练的实例级场景编辑与动画,论文已被 NeurIPS 2026 接收。

  22. arXiv stat.ML13

    ResTGP:面向高维数据的残差树高斯过程建模框架

    研究者提出贝叶斯残差树高斯过程方法 ResTGP,用于处理多维域中具有异质结构的大规模空间数据。该方法沿二进树在多个分辨率上迭代分解预测过程与残差过程,实现灵活的多尺度协方差建模与分治计算,并基于递归消息传递的贝叶斯推断策略使计算量在给定树下随样本量线性增长。论文还证明了非参数回归框架下连续函数估计的后验一致性,数值实验与风暴潮应用验证了其优势。

  23. arXiv cs.AI31

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。

  24. arXiv cs.CV24

    MeshQuery:用智能体做 UV 展开的接缝规划

    MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。