非正则条件下的交叉拟合:基于局部性的正态性与推断
针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。
针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。
针对大语言模型强化学习通常最大化期望回报、概率求和无法指出哪条解法真正有效的问题,研究者提出 Tropical Reinforcement Learning,用取最大值的热带半环替代概率相加,使状态价值对应最可能被验证解法的对数概率并附带可复用路径。
对四个开放权重类型化决策模型的研究发现,模型返回的概率主要取决于选项标签而非其定义,即存在"选项标签偏差"。删除全部定义后准确率几乎不变(laya-td:0.8559 对 0.8487),而将选项改名为 A、B 后准确率提升 +0.1511。
研究对正则化经验风险加入随机线性项 z~N(0,σ²I_d) 后,释放确定性梯度下降第 N 次迭代所得有限计算的差分隐私性质。在强凸、光滑且 Hessian 满足 Lipschitz 条件下,证明 z↦w_N 在隐私论证所用有界域上是 C¹ 微分同胚,并给出 Jacobian 最小奇异值的定量下界。
研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。
推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。
GRAFT 是一个持续多教师蒸馏框架,让统一骨干网络从开放序列的基础模型中逐步获取能力,新增教师时只需一次蒸馏而非全量重蒸馏。它引入 Teacher Specific Readout Tokens 为每个教师提供独立读出,并用 Geometry Agnostic Relational Loss 对齐视觉语言教师。
研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。
针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。
一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。
研究者提出由编码智能体驱动、带人工验证的转换流程,将 BIRD 的 Text-to-SQL 基准转为面向文档数据库的 AptMQL-Bench,包含 21 个数据库、3,186 条自然语言请求及对应 MQL 查询,迁移自 SQLite 且无数据丢失。
Ian Osband 提出 horizon loss,将交叉熵视为"耐心的准确率",并按剩余训练量截断,从而在训练后期向精确策略梯度过渡。在 MNIST 及 ImageNet 上使用 ResNet-50、ResNet-101 和 ViT-S/16 测试,该方法在固定学习率下提升 top-1 准确率,且标签噪声越大增益越明显。
研究对固定 YOLOv8s 行人检测器的后置解释在 PIE 与 JAAD 数据集上进行审计,发现基于删除的忠实度与解释时的检测强度强相关,D-RISE 的 Spearman 相关系数达 0.70 至 0.82,使朴素置信度分层比较不可靠。
研究者发布 SymCE,包含 4,707 道本科代数与实分析假猜想,每题配有可执行的逐定理 Python 验证器,验证器同时充当奖励函数。
研究将摊销结构化随机变分推理(Amortized Structured Stochastic Variational Inference)用于高斯过程隐变量模型,使隐空间的变分后验可条件依赖于诱导点取值,突破了原有诱导点与隐变量间平均场近似的限制。这一更灵活的变分后验在多项数据流形重建指标上取得提升。
ConvoDrift 是一个用于建模固定语义意图下渐进式风格语调漂移的多轮对话数据集,基于 15,727 个共享多轮对话结构构建,每段对话含六组提示词-回复对并标注风格漂移与方向标签。
研究通过可解析的事实回忆模型揭示,Muon 对应的 Spectral GF 将 subject 与 relation 依赖信息的学习时间比从 GF 的 Θ̃(√(S/R)) 降至 Θ̃(1),且固定 S、R 时误差随训练时间 T 以 exp(-poly(T)) 衰减,而 GF 仅为 1/(T log T)。
研究者提出 Predictively Oriented Gaussian Processes(PrO-GPs),将预测不确定性作为首要推断目标,以应对核函数与观测模型选择不当导致的模型误配问题。由于非参数模型的 PrO 后验无法直接计算,作者推导出简化形式与实用采样方案以实现高效计算。合成与真实数据实验显示,在模型误配下 PrO-GPs 的预测分布校准优于标准 GP 方法。
研究者提出 HOST,一种高效高斯 DAG 学习算法,用逐节点留出评分与凸回归替代子集搜索,且无需预先给定入度上界。在合适条件下,HOST 可在多项式时间内以 d log p 量级的样本复杂度精确恢复最大入度为 d 的 p 节点 DAG。实验显示其图恢复效果具竞争力,运行时间扩展性良好。
研究提出增量认知诊断框架 CLEAN,通过严格拓扑二分协议冻结历史诊断函数,并用确定性正交列掩码切断梯度干扰,同时以可扩展满秩分支学习新概念。在三个大规模教育数据集上,CLEAN 实现零 Representation Drift(RD),旧题指标与静态锚点完全一致,新题表现与强持续学习基线相当或更优。
研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。
针对每轮查询梯度、每 m 轮查询一次 Hessian 的惰性二阶预言机设定,研究者通过新的块零链构造证明了寻找 ε-解所需总迭代次数的下界为 Ω(m + m^{1/7} ε^{-2/7}),并提出新方法达到 Õ(m + m^{1/7} ε^{-2/7}) 的上界。
研究提出 THPL 生成式投喂决策框架,用于 RAS 虹鳟养殖:Fishsort 提取轨迹并建立活动系数 AC,与专家标注投喂强度呈显著单调正相关(Spearman ρ = 0.925,p < 0.001)。
Physical AI Smart Spaces 发布,这是首个同时提供大规模、多类别、多摄像头 3D 感知数据的室内智能空间基准,含近 1800 台摄像头拍摄的超 280 小时同步 1080p 视频,覆盖仓库、医院、零售等场景。
研究提出一种结合代理模型与强化学习的控制框架,用于优化核物理实验中的动态极化靶。基于 APOLLO 低温靶系统运行数据,高斯过程回归模型能提供校准的不确定性估计并识别训练分布外区域,MLP 对分布偏移敏感性有限。采用下置信界奖励训练的强化学习智能体,将操作员操作效果提升近 2 倍。
研究提出 JEPA 早期训练稳定性理论,将表征坍缩归因于驱动力 γ 与衰减效应 σ 的竞争,并预测出相边界,在超过 800 组 Tabular-JEPA 配置上得到验证。
一项预注册基准在 8 个公开数据集(200 至 20,000 训练行)和 4 个原生小型临床数据集上,对 CTGAN、TVAE、TabDDPM 等七种生成器进行了 2,220 次运行。在 24 个(数据集,深度模型)组合中有 23 个,深度模型在任何训练规模下都未超过最佳平凡基线。预注册预测的“小规模下深度模型排名不稳定”被证伪,相邻规模间平均 Kendall tau 为 0.806。
研究者提出 Lexicographic Multi-Objective On-Policy Distillation(LMOPD),一种按显式优先级整合奖励专精策略的多教师方法,通过字典序路由与对数策略修正投影保护高优先级能力。
因果图中对变量做任意聚类会改变变量间的因果关系并导致错误结论。研究提出一类基于原图 c-components 条件的聚类操作,在可识别性与不可识别性均被保留时称为识别不变,并给出实际场景中的应用演示。
研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。
研究者提出 TPBench,用于评估对话压缩中的"转折点驱逐"失败:压缩器可能保留事实却丢掉改变事实的那一轮对话。TPBench 在相同名义保留预算下评测三个信息目标,P1 为用户初始目标,P2 为用户修改后槽位的当前值,P3 为两者兼有,答案取自 MultiWOZ 与 SGD 的人工对话状态标注。
研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。
研究者预训练了共享内存的 Looped Transformer(LPT),仅第一次递归写入 key-value cache,后续递归读取该缓存并保留自身短窗口,结果共享内存不但不损质量反而提升质量。
LINEUP 将个性化能力与逐用户可训练状态解耦,每个目标用户只需优化 8 个标量,而对比的 private-LoRA 配置每用户需 419 万参数。该方法学习一组可复用的低秩个性化因子,通过用户条件召回与查询相关校准组合,并把目标用户适配限制在共享修正空间上的极小用户编码中。
研究者提出 Hyperbolic Entropy Steering(HEST),将隐藏状态嵌入 Poincaré 球,用仅以模型自身 next-token 熵为标签的轻量探针,在熵超过阈值的 token 处沿测地线调整状态。
研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。
FinDialogLens 是一个混合 LLM 流水线,通过多轮对话事件抽取识别金融聊天室中被遗漏的 RFQ 交易,用微调小模型检测 RFQ 触发消息与价格/成交结果,再由 RFQ-Level Module 切分事件窗口、Trade Engine 填充论元角色。
研究者提出贝叶斯残差树高斯过程方法 ResTGP,用于处理多维域中具有异质结构的大规模空间数据。该方法沿二进树在多个分辨率上迭代分解预测过程与残差过程,实现灵活的多尺度协方差建模与分治计算,并基于递归消息传递的贝叶斯推断策略使计算量在给定树下随样本量线性增长。论文还证明了非参数回归框架下连续函数估计的后验一致性,数值实验与风暴潮应用验证了其优势。
研究用两阶段分类流水线处理 1,362 家英国上市公司 2020-2025 年的 9,821 份年报,发现提及 AI 风险的报告占比从 2.8% 升至 41.2%,AI 采用披露从 13.8% 升至 45.2%,供应商提及集中在以 Microsoft 为首的少数厂商。2025 年 41.2% 的报告提及 AI 风险,但仅 4.3% 属于实质性披露,危害披露全语料仅 7 份。
研究揭示固定目标异常检测器存在"收敛坍缩":优化越好、检测越差,因收敛后残差信号在异常与正常数据上同时消失。作者提出闭式、免训练、CPU 高效的 Kernel Contraction Matching(KCM),并在此基础上引入 Kernel-Anchored Regularizer(KAR),惩罚神经预测偏离训练目标的核加权平均。
研究者提出 SSU-LSF,首个专为地理科学 Mamba 类状态空间模型打造的机器遗忘框架,用于消除陆面预报中非平稳干扰事件对状态转移矩阵的隐性偏差。