跳到正文
10月5日周一
  1. arXiv cs.AI22

    强化学习优化核物理散射实验中的靶极化

    研究提出一种结合代理模型与强化学习的控制框架,用于优化核物理实验中的动态极化靶。基于 APOLLO 低温靶系统运行数据,高斯过程回归模型能提供校准的不确定性估计并识别训练分布外区域,MLP 对分布偏移敏感性有限。采用下置信界奖励训练的强化学习智能体,将操作员操作效果提升近 2 倍。

  2. arXiv cs.CL22

    超越分数对齐:LLM-as-a-Judge 残余评判难度的心理测量学分析

    研究从心理测量学视角分析 LLM-as-a-Judge,对人工与 LLM 评分分别拟合 Many-Facet Rasch 模型,提出"残余难度"指标以衡量评判难度。在 SummEval 上测试 17 个开源权重 LLM 评委发现,潜在摘要质量的中等对齐并不意味着残余难度对齐,且这种不匹配强烈依赖评估维度:一致性维度偏向 LLM 更难,连贯性维度偏向人类更难。

  3. arXiv stat.ML29

    深度表格生成模型在多大训练规模下不再优于平凡基线?一项基于临床与标准数据集规模阶梯的预注册基准测试

    一项预注册基准在 8 个公开数据集(200 至 20,000 训练行)和 4 个原生小型临床数据集上,对 CTGAN、TVAE、TabDDPM 等七种生成器进行了 2,220 次运行。在 24 个(数据集,深度模型)组合中有 23 个,深度模型在任何训练规模下都未超过最佳平凡基线。预注册预测的“小规模下深度模型排名不稳定”被证伪,相邻规模间平均 Kendall tau 为 0.806。

  4. arXiv stat.ML13

    1-Bit 反馈下的近最优固定置信度最佳臂识别

    研究在严格 1-bit 反馈约束下的固定置信度最佳臂识别问题,学习者每轮只能收到一个比特,判断采样奖励是否属于所选查询集。作者提出基于随机阈值查询与截断尾积分恒等式的时间一致 1-bit 均值估计原语,并嵌入候选-挑战者算法:固定截断版本给出 anytime (ε,δ)-PAC 保证,分阶段自适应截断版本实现间隙自适应样本复杂度。

  5. arXiv stat.ML13

    高维渐近理论与隐私迁移学习的数据集选择

    研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。

  6. arXiv cs.CL27

    TPBench:面向对话压缩的转折点基准

    研究者提出 TPBench,用于评估对话压缩中的"转折点驱逐"失败:压缩器可能保留事实却丢掉改变事实的那一轮对话。TPBench 在相同名义保留预算下评测三个信息目标,P1 为用户初始目标,P2 为用户修改后槽位的当前值,P3 为两者兼有,答案取自 MultiWOZ 与 SGD 的人工对话状态标注。

  7. arXiv cs.LG20

    Co-design Gym:面向具身与策略协同优化的统一基准

    研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。

  8. arXiv cs.LG20

    不同假设下 MS/MS 谱图分子指纹预测的最近邻基线

    针对 MS/MS 谱图预测分子指纹,最近邻检索已被证明是强基线,多种变体可匹敌或超越当前深度学习模型。该报告系统比较了在推理阶段假设可用信息不同的多种最近邻变体,展示这些假设如何影响性能,目标是建立更严格的基线以支持更严谨的基准测试并更好衡量该领域进展。

  9. arXiv cs.LG29

    LINEUP:将个性化与逐用户适配解耦,每个用户只需优化 8 个标量

    LINEUP 将个性化能力与逐用户可训练状态解耦,每个目标用户只需优化 8 个标量,而对比的 private-LoRA 配置每用户需 419 万参数。该方法学习一组可复用的低秩个性化因子,通过用户条件召回与查询相关校准组合,并把目标用户适配限制在共享修正空间上的极小用户编码中。

  10. arXiv cs.CL22

    WakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略

    WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。

  11. arXiv cs.CV12

    4DFEID:4D 面部表情强度数据集发布

    研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。

  12. arXiv cs.CL17

    多模态声明验证对 LLM 改写有多鲁棒?

    研究测试了 11 个开源权重模型(覆盖 5 个 VLM 家族、2B 至 38B 参数)在多模态声明验证任务中对 LLM 改写的鲁棒性。结果显示多数模型准确率无显著下降,但概率出现一致性偏移:对冲类改写几乎在所有模型上引发显著偏移,增强类效果较弱,语法纠错等常规润色几乎无影响。

  13. arXiv stat.ML29

    AREX:面向 Flow Matching 少步采样的仿射残差指数积分器

    AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。

  14. arXiv cs.CV30

    SCION:用实例化神经基元实现场景组合

    SCION 是一种分层组合式场景表示,用可复用基元的紧凑词表加轻量级世界空间实例替代独立高斯,通过离散与连续场景参数的联合优化拟合多视图捕捉,在 1.2 MB 下仍保持高质量。它取得优于现有高斯压缩方法的率失真表现,并支持无需重训练的实例级场景编辑与动画,论文已被 NeurIPS 2026 接收。

  15. arXiv stat.ML13

    ResTGP:面向高维数据的残差树高斯过程建模框架

    研究者提出贝叶斯残差树高斯过程方法 ResTGP,用于处理多维域中具有异质结构的大规模空间数据。该方法沿二进树在多个分辨率上迭代分解预测过程与残差过程,实现灵活的多尺度协方差建模与分治计算,并基于递归消息传递的贝叶斯推断策略使计算量在给定树下随样本量线性增长。论文还证明了非参数回归框架下连续函数估计的后验一致性,数值实验与风暴潮应用验证了其优势。

  16. arXiv cs.AI31

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。

  17. arXiv cs.CV24

    MeshQuery:用智能体做 UV 展开的接缝规划

    MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。

  18. arXiv cs.AI31

    AI Risk Observatory:用 LLM 分析英国上市公司年报中的 AI 风险披露

    研究用两阶段分类流水线处理 1,362 家英国上市公司 2020-2025 年的 9,821 份年报,发现提及 AI 风险的报告占比从 2.8% 升至 41.2%,AI 采用披露从 13.8% 升至 45.2%,供应商提及集中在以 Microsoft 为首的少数厂商。2025 年 41.2% 的报告提及 AI 风险,但仅 4.3% 属于实质性披露,危害披露全语料仅 7 份。

  19. arXiv cs.AI22

    如何实现敏感辩论:面向 AI 辩论的实例最优协议

    研究者提出一种新的 AI 辩论协议,针对可稳定分解为子问题的问题类别,在正确性上实现最坏情况保证,并使双方辩手诚实作答成为占优策略均衡,而非 Stackelberg 均衡。该工作还证明了黑盒下界,表明新协议在实例层面最优,仅靠黑盒查询人类判断的任何协议都无法超越它。相关结论通过将稳定问题分解与查询复杂度中的分数块敏感度概念相关联而得到。

  20. arXiv cs.LG20

    固定目标异常检测器的收敛坍缩问题:用核锚定局部性正则化(KAR)缓解

    研究揭示固定目标异常检测器存在"收敛坍缩":优化越好、检测越差,因收敛后残差信号在异常与正常数据上同时消失。作者提出闭式、免训练、CPU 高效的 Kernel Contraction Matching(KCM),并在此基础上引入 Kernel-Anchored Regularizer(KAR),惩罚神经预测偏离训练目标的核加权平均。

  21. arXiv cs.CV22

    SymRegFlow:面向视频世界模型的对称正则化流匹配

    SymRegFlow 是一个对称正则化流匹配框架,可在无新视角 RGB 真值监督的情况下,实现连续视角下的多视角一致视频生成。该方法通过几何变换将源视图转为带噪锚点,结合掩码双锚点监督与跨锚点去噪输出一致性来抑制锚点误差,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优解。

  22. arXiv cs.CV24

    TRAC:面向高效自回归视频生成的轨迹感知复用与自适应校正框架

    TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。

  23. arXiv cs.CL22

    心理健康污名自动评估基准:LLM 常过度预测污名,除非给出明确操作规则

    研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。

10月3日周六
10月2日周五