跳到正文
今天10月7日周三366 条
  1. arXiv cs.LG22

    重新审视深度强化学习中的时间正则化:CATS 实现平滑控制

    研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。

  2. arXiv cs.LG22

    ApexQuant:无需数据的弹性量化,通过残差重各向同性化实现

    ApexQuant 是一种无需校准的量化方法,通过递归重量化残差误差,可作为现有量化器的精炼层。该方法在四个开源 LLM 及地球观测和医疗领域验证,4 bit 下接近全精度,并给出所测最佳 2 bit 方案,完全无需数据。每个前缀本身即为有效的低比特模型,单一产物可服务多种精度。

  3. arXiv cs.LG20

    FreshCast:为冻结的时间序列预测模型刷新检索记忆

    FreshCast 是一个即插即用检索框架,在保持预测模型冻结的前提下,用新观测持续更新非参数记忆,并通过关系核回归生成记忆预测、在验证集上闭式校准其权重。在七个基准和十种预测架构上,FreshCast 对每个模型和输入长度都降低了平均 MSE,输入长度 96 和 720 时分别降低 14.6% 和 5.6%。

  4. arXiv cs.LG14

    AFA-BANDIT:预算约束下可证明近最优的在线多特征分类

    研究者将在线主动特征获取(AFA)建模为带背包的组合 Bandits(BwK)问题,在全局预算约束下同时决定特征获取与预测,并给出优于标准 BwK 的 regret 上界。为规避指数级动作空间,他们提出 LP-Chain,以随特征数线性增长的代价感知特征子集链进行搜索。在合成数据上,LP-Chain 优于基于 HEDGE 的 BwK 和深度 RL 的在线 AFA 基线,并能更好地扩展到更多特征。

  5. arXiv cs.LG22

    JEPA 世界模型如何用逆动力学保留不稳定模态

    研究指出,JEPA 世界模型仅靠下一步预测加防坍缩正则,无法保证保留可控的不稳定模态,训练损失最小化时这些模态仍可能被坍缩。为此作者在世界模型训练中加入动作重建目标(逆动力学损失),并证明精确动作重建可使编码器在有限时域可达子空间上单射。在 CartPole、Walker2D 和 PointMaze 上的实验表明,该控制感知表示学习方法在非线性视觉控制任务中同样有效。

  6. arXiv cs.LG22

    激活去噪:并行与串行 LLM 量化鲁棒性对比研究

    针对并行量化误差沿残差流累积的问题,研究者提出"激活去噪"方法,将上游误差建模为噪声,通过预处理加度量加权舍入进行正则化,在保持全并行量化的同时恢复串行量化的大部分收益,耗时仅为后者一小部分。该方法形成的深度累积平滑惩罚可抑制量化误差放大,且与量化中常用的正交旋转互补、效果叠加。

  7. arXiv cs.LG15

    通过有限深度策略敏感性适应智能体行为变化

    研究者提出一种有限深度框架,通过近似策略 Hessian 和混合导数来估计策略敏感性,从而适应其他智能体行为变化,无需大量新交互数据。该方法具有可调节的传播深度,并推导了截断误差界,深度越大误差越小,全时域传播时误差消失。在信念驱动的追逃博弈中,该方法估计精度和策略适应均优于基线,基于敏感性的初始化提升了零样本回报及后续微调效果。

  8. arXiv cs.LG22

    SemARC:通过自适应采集与序列融合实现高效多模态推理

    SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。

  9. arXiv cs.LG34

    Fork-and-Flush:让 Autoresearch 智能体逃离「想法盆地」

    研究发现,同一 Autoresearch 智能体在相同任务上的独立运行常停滞在分数差异明显的「想法盆地」中,即使追加大量算力差距仍持续。为此提出的 fork-and-flush 方法将智能体分叉为多条并行轨迹,各自继承累积工作区但使用全新对话上下文,运行固定时长后从得分最高的轨迹继续。

  10. arXiv cs.LG18

    GraphPDHG:面向图鞍点问题的神经算法推理框架

    研究者提出基于 Chambolle-Pock 原始-对偶混合梯度(PDHG)方法的消息传递框架 GraphPDHG,用于求解一般图鞍点问题。理论上该网络能通过模拟 PDHG 高效求解一类图鞍点问题,并可学习加速版 PDHG 算法;实验表明其作为二阶优化方法 SSNAL 的学习式热启动表现良好,且与 PDHG 对齐后比未对齐的 GNN 基线具有更强的规模泛化能力。

  11. arXiv cs.LG18

    BiToK-SD:面向大语言模型自蒸馏的双层 Top-K token 选择方法

    研究者提出 BiToK-SD,一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中自适应学习哪些 token 位置最值得蒸馏。该方法将 Top-K token 选择建模为可微的阈值松弛作为下层问题,上层问题则对选中位置执行知识蒸馏,使选择随学生策略演化而调整。在数学推理基准上,BiToK-SD 在全部对比方法中取得最佳平均性能,且仅需轻量额外计算。

  12. arXiv cs.LG13

    双曲表示学习在多分类数据上的隐式偏差:Busemann 风险视角

    研究固定类原型下双曲多分类中 Riemannian 梯度流的隐式偏差,框架覆盖交叉熵等一般 PERM 损失。证明径向二分性:漂移系数 μ 为正时半径趋于理想边界且 r(t)=½log t+O(1),持续为负则有限时间内回到大半径阈值;边界方向收敛到 Busemann 风险的临界点,为边界饱和与近边界聚类提供渐近解释。该工作已被 NeurIPS 2026 接收为 Spotlight。

  13. arXiv cs.LG24

    SoloQ:面向扩散语言模型的无校准量化框架

    SoloQ 是一种无需校准数据的扩散语言模型量化框架,通过将权重和激活映射到归一化旋转基,实现数据无关的量化。在 LLaDA、Dream、Fast-LLM v2 和 Nemotron-Labs-Diffusion 上,SoloQ 在 4-bit 量化下保持精度并超越基于校准的基线;采用 NVFP4 时峰值内存降低最多 2.61 倍,端到端推理加速最多 2.24 倍。

  14. arXiv cs.LG24

    冻结扩散模型的可识别世界模型:ConDA 对齐方法

    研究者提出 Contrastive Diffusion Alignment(ConDA),在冻结的预训练扩散模型潜变量之上仅学习一个轻量对齐映射,即可获得可识别的坐标表示。在 TCL/GCL 假设下,该方法能将潜在动力学状态识别到排列和逐分量可逆变换的程度,并保留潜在动态结构因果模型。在物理与机器人视频系统上,TCL 和 GCL 变体实现了近乎完美的分块状态恢复,并在模拟落体系统中实现精确恢复。

  15. arXiv cs.LG12

    知识图谱表示学习中的不确定性研究

    这篇博士论文系统研究了知识图谱嵌入(KGE)中的三类不确定性:来自不完整、噪声或概率输入的知识不确定性,训练随机性引发的算法不确定性,以及模型输出的预测不确定性。针对算法不确定性,论文提出基于投票的聚合框架;针对预测不确定性,将 conformal prediction 适配到 KGE,构建具有无分布覆盖保证的答案集;针对知识不确定性,提出统计有效的预测区间及基于嵌入向量的概率推理近似方法。

  16. arXiv cs.LG27

    神经 PDE 求解器是否学到了正确的动力学?——一个评估框架

    研究者提出一套评估框架,通过演化邻近初始状态的集合、与直接数值模拟对比,从误差形成、集合几何和极端事件三方面检验神经 PDE 求解器的动力学保真度。在二维 Kolmogorov 流上的实验显示,更小的轨迹误差可能来自更弱的误差放大而非更准确的局部更新,模型还能匹配集合整体散布与有效维度却漏掉邻近状态发散的空间方向。结果表明预测精度提升并不必然意味着动力学更忠实。

  17. arXiv stat.ML14

    考虑集电路(Consideration Circuits):超越单一 Softmax 的深度分离与普适性

    研究者提出考虑集电路(CC),一种由多项 logit(MNL)单元构成的有向无环图定义的多阶段选择模型。在三选项折中任务上,CC 展现出显著的深度-范数分离:深度从 2 增至 3,达到误差 ε 所需的最优最大偏好向量范数从 Θ(log(1/ε)/ε) 降至 Θ(log(1/ε))。实验中,参数少于 600 的树状电路在四个固定池基准和 Expedia 时间划分上取得最低平均测试 NLL。

  18. arXiv stat.ML15

    掩码离散扩散中 tau-leaping 的调度优化

    研究针对掩码扩散模型 tau-leaping 采样中因并行去噪引入的分解误差 ε_fact,建立了将其与调度方案及目标依赖结构分离的精确积分表示,并给出最优调度的递归平稳方程。分析显示:当依赖密度 ρ 随维度 N 增大一致收敛到严格正连续分布时,调度优化只能改善 ε_fact 的首阶常数;若 ρ 退化,则可改善渐近阶。

  19. arXiv stat.ML18

    含隐藏混杂因子的线性 ODE 系统可辨识性分析

    该论文对含隐藏混杂因子的线性 ODE 系统进行可辨识性分析,填补了潜变量与系统交互时可辨识条件的研究空白。研究分两种情况:潜混杂因子无因果关系但按时间 t 的多项式等函数形式演化;潜变量因果关系由 DAG 描述。作者在单/多轨迹的连续与离散观测条件下给出详细分析,并用仿真验证理论结果。

  20. arXiv stat.ML22

    Transformer 强化学习分层推理奖励:达到 Minimax 最优速率

    研究将推理任务的奖励建模为响应空间上的分层函数,由无穷多个局部组件构成,每个组件仅在前序组件解决后才生效。基于 Transformer 的 actor-critic 算法在采样、拟合 critic 与策略更新间交替,在查询预算和正则化强度上达到 minimax 最优速率,对固定提示词数量也最优。

  21. arXiv stat.ML22

    Spectra:基于扩散模型的仿真推断测试时先验自适应方法

    Spectra 是一种面向扩散模型仿真推断(SBI)的测试时自适应方法,通过精确的 score-transport 恒等式,在冻结的扩散模型上以闭式解获得适配后的 score,无需额外仿真或训练。在六个 SBI 基准上,Spectra 在先验大幅偏移下实现准确适配,且在线采样成本低,使预训练 SBI 模型能在测试时纳入更新的先验信息。

  22. arXiv stat.ML20

    通过有限阶松弛将路径梯度扩展到离散随机变量

    研究者提出一种通用框架,可为 Poisson 等常见离散随机变量构造有限阶精确路径梯度估计器,该估计器是所有对次数不超过某阶多项式无偏的解中范数最小的解。它保留硬前向采样、无需温度调参,几行代码即可实现,且在所有可行解中唯一并最小化权重方差。实验显示,其低阶方法在线性、非线性和分层潜变量模型上匹配或超越调优基线,并在每项运行时基准中快于竞品。

  23. arXiv stat.ML12

    用聚合归一化流链实现复杂仿真模型的似然近似与推断

    研究提出用 n-聚合归一化流链做仿真推断中的似然近似,前向复杂仿真模型的多组复制观测数据依次通过多组双射变换,前 k 组变换的参数按最优性顺序估计,不受其余 n-k 组影响。该框架通过经验似然估计与带混合分布的序贯决策两条数学路径更新和聚合归一化流参数,并附带一个以正向仿真参数为条件的代理模型,支持样本生成及贝叶斯范式下的推断、假设检验与不确定性量化。