LLM 会依据已知信息行动吗?从伙伴表征到协作动作
研究在 Hanabi 衍生环境中测试八款 LLM:线性探针识别意图约定的准确率明显高于目标约定,但接收决策并不总与发送方约定一致。将约定转为外部动作建议带来的协作提升平均大于规则陈述,Qwen3-8B 案例中模型对动作建议的敏感度远高于规则陈述。
研究在 Hanabi 衍生环境中测试八款 LLM:线性探针识别意图约定的准确率明显高于目标约定,但接收决策并不总与发送方约定一致。将约定转为外部动作建议带来的协作提升平均大于规则陈述,Qwen3-8B 案例中模型对动作建议的敏感度远高于规则陈述。
研究测试了 Chronos-2、TimesFM-2.5 和 TabPFN-TS 在强制工程系统上的反事实辨识能力,发现 TimesFM-2.5 和 TabPFN-TS 通过默认协变量接口表现为无记忆(TimesFM-2.5 的 R²=1.000),Chronos-2 虽能辨识动态但存在衰减,预测效应仅为真实值的 0.33-0.80。
研究者提出 A2D,一个免训练框架,可将 AR 模型的后训练权重更新直接复用到扩散语言模型上。AR 与扩散后训练更新在权重空间近乎正交,却能带来更一致的表示变化,组合两者可同时保留双方收益。
研究在 log-concave 噪声的随机效用模型下,从人类比较反馈中恢复物品排序所需的样本量。反馈分完整排序与仅揭示第一名两种类型,作者为二者建立了最坏情况样本复杂度下界,并提出匹配至对数因子的算法,且无需知道噪声分布、仅需方差上界。结果表明仅知胜者反馈的排序问题本质上更难,其样本复杂度取决于物品集合中的最小获胜概率。
研究者提出 Generalized Matheron Variational Implicit Processes(GMVIP),一种针对隐式过程先验的路径式变分族,用于后验推断。
研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。
ApexQuant 是一种无需校准的量化方法,通过递归重量化残差误差,可作为现有量化器的精炼层。该方法在四个开源 LLM 及地球观测和医疗领域验证,4 bit 下接近全精度,并给出所测最佳 2 bit 方案,完全无需数据。每个前缀本身即为有效的低比特模型,单一产物可服务多种精度。
FC-SWE 是一种失败条件化强化学习框架,在补丁验证失败后把失败补丁与验证器反馈作为上下文,让智能体在仓库原始状态下生成恢复轨迹。
研究审计了 BitNet b1.58、Falcon-E 和 BitCPM 三个实验室的三元语言模型导出流程,发现文档化的 bf16 转换步骤会使已发布 checkpoint 中 0.83%-1.77% 的三元码与 fp32 量化结果不一致。
FreshCast 是一个即插即用检索框架,在保持预测模型冻结的前提下,用新观测持续更新非参数记忆,并通过关系核回归生成记忆预测、在验证集上闭式校准其权重。在七个基准和十种预测架构上,FreshCast 对每个模型和输入长度都降低了平均 MSE,输入长度 96 和 720 时分别降低 14.6% 和 5.6%。
TRACE 是面向 MoE 语言模型 RL 训练的 FP4 量化框架,用 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接缩小训练与 rollout 两条量化执行路径的差异。
研究者提出 BAR,一个面向医疗知识图谱的预算感知 LLM 推理框架,通过 plan-navigate-verify 循环在患者特定预算下检索证据并支持引用溯源。
研究者将在线主动特征获取(AFA)建模为带背包的组合 Bandits(BwK)问题,在全局预算约束下同时决定特征获取与预测,并给出优于标准 BwK 的 regret 上界。为规避指数级动作空间,他们提出 LP-Chain,以随特征数线性增长的代价感知特征子集链进行搜索。在合成数据上,LP-Chain 优于基于 HEDGE 的 BwK 和深度 RL 的在线 AFA 基线,并能更好地扩展到更多特征。
研究指出,JEPA 世界模型仅靠下一步预测加防坍缩正则,无法保证保留可控的不稳定模态,训练损失最小化时这些模态仍可能被坍缩。为此作者在世界模型训练中加入动作重建目标(逆动力学损失),并证明精确动作重建可使编码器在有限时域可达子空间上单射。在 CartPole、Walker2D 和 PointMaze 上的实验表明,该控制感知表示学习方法在非线性视觉控制任务中同样有效。
一项针对混合 Fourier 神经算子的数值案例研究表明,在模拟相干 4f 处理器上,定向搜索找到的器件在 120 个模型中的留出误差达到 200 个随机 Monte Carlo 器件最大值的 1.08-3.10 倍。
针对并行量化误差沿残差流累积的问题,研究者提出"激活去噪"方法,将上游误差建模为噪声,通过预处理加度量加权舍入进行正则化,在保持全并行量化的同时恢复串行量化的大部分收益,耗时仅为后者一小部分。该方法形成的深度累积平滑惩罚可抑制量化误差放大,且与量化中常用的正交旋转互补、效果叠加。
研究者提出一种有限深度框架,通过近似策略 Hessian 和混合导数来估计策略敏感性,从而适应其他智能体行为变化,无需大量新交互数据。该方法具有可调节的传播深度,并推导了截断误差界,深度越大误差越小,全时域传播时误差消失。在信念驱动的追逃博弈中,该方法估计精度和策略适应均优于基线,基于敏感性的初始化提升了零样本回报及后续微调效果。
SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。
研究发现,同一 Autoresearch 智能体在相同任务上的独立运行常停滞在分数差异明显的「想法盆地」中,即使追加大量算力差距仍持续。为此提出的 fork-and-flush 方法将智能体分叉为多条并行轨迹,各自继承累积工作区但使用全新对话上下文,运行固定时长后从得分最高的轨迹继续。
研究者提出 Weight Oracles,通过微调语言模型直接读取目标网络原始权重来诊断其属性,无需行为测试。第一阶段中,explainer LLM 借助分阶段课程与外部链式计算,学会从权重模拟小型 Transformer 的前向传播,在未见目标上达到 99% 留出准确率。
研究揭示现成 MoE 模型在智能体轨迹中已存在专家选择专门化结构:执行语义相似操作(如 READ、UPDATE)的轮次之间专家路由重叠度更高。标准 RL 算法忽略这一结构,导致训练中 MoE 路由失控,限制任务性能与推理效率。
研究者提出基于 Chambolle-Pock 原始-对偶混合梯度(PDHG)方法的消息传递框架 GraphPDHG,用于求解一般图鞍点问题。理论上该网络能通过模拟 PDHG 高效求解一类图鞍点问题,并可学习加速版 PDHG 算法;实验表明其作为二阶优化方法 SSNAL 的学习式热启动表现良好,且与 PDHG 对齐后比未对齐的 GNN 基线具有更强的规模泛化能力。
研究者提出 BiToK-SD,一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中自适应学习哪些 token 位置最值得蒸馏。该方法将 Top-K token 选择建模为可微的阈值松弛作为下层问题,上层问题则对选中位置执行知识蒸馏,使选择随学生策略演化而调整。在数学推理基准上,BiToK-SD 在全部对比方法中取得最佳平均性能,且仅需轻量额外计算。
研究固定类原型下双曲多分类中 Riemannian 梯度流的隐式偏差,框架覆盖交叉熵等一般 PERM 损失。证明径向二分性:漂移系数 μ 为正时半径趋于理想边界且 r(t)=½log t+O(1),持续为负则有限时间内回到大半径阈值;边界方向收敛到 Busemann 风险的临界点,为边界饱和与近边界聚类提供渐近解释。该工作已被 NeurIPS 2026 接收为 Spotlight。
SoloQ 是一种无需校准数据的扩散语言模型量化框架,通过将权重和激活映射到归一化旋转基,实现数据无关的量化。在 LLaDA、Dream、Fast-LLM v2 和 Nemotron-Labs-Diffusion 上,SoloQ 在 4-bit 量化下保持精度并超越基于校准的基线;采用 NVFP4 时峰值内存降低最多 2.61 倍,端到端推理加速最多 2.24 倍。
一项基于 Panama 负荷数据集的研究发现,注意力模型预测峰值的时刻中位误差为 0 h、精确匹配率 51.6%,而注意力描述符 Ψ_out 的 argmax 中位误差达 5 h、精确匹配率为 0%,31 个窗口中有 27 个预测峰值更接近观测峰值。
研究者提出 Contrastive Diffusion Alignment(ConDA),在冻结的预训练扩散模型潜变量之上仅学习一个轻量对齐映射,即可获得可识别的坐标表示。在 TCL/GCL 假设下,该方法能将潜在动力学状态识别到排列和逐分量可逆变换的程度,并保留潜在动态结构因果模型。在物理与机器人视频系统上,TCL 和 GCL 变体实现了近乎完美的分块状态恢复,并在模拟落体系统中实现精确恢复。
这篇博士论文系统研究了知识图谱嵌入(KGE)中的三类不确定性:来自不完整、噪声或概率输入的知识不确定性,训练随机性引发的算法不确定性,以及模型输出的预测不确定性。针对算法不确定性,论文提出基于投票的聚合框架;针对预测不确定性,将 conformal prediction 适配到 KGE,构建具有无分布覆盖保证的答案集;针对知识不确定性,提出统计有效的预测区间及基于嵌入向量的概率推理近似方法。
研究者提出一套评估框架,通过演化邻近初始状态的集合、与直接数值模拟对比,从误差形成、集合几何和极端事件三方面检验神经 PDE 求解器的动力学保真度。在二维 Kolmogorov 流上的实验显示,更小的轨迹误差可能来自更弱的误差放大而非更准确的局部更新,模型还能匹配集合整体散布与有效维度却漏掉邻近状态发散的空间方向。结果表明预测精度提升并不必然意味着动力学更忠实。
研究团队提出 Robust Async-Fed-Q,一种基于 epoch 的联邦强化学习算法,在智能体端对 Bellman 最优算子做方差缩减估计、在服务器端做鲁棒聚合,使部分智能体发送任意损坏信息时仍能保留协作的样本效率收益。
研究者提出 Guidance-Augmented GRPO(GA-GRPO)统一理论框架,将外部引导建模为改写问题分布的随机引导算子 G,并把策略梯度估计量分析为偏差受引导散度 delta_G 约束的 on-policy 估计量,可涵盖 GRPO、LUFFY、ExPO、PAPO、TAPO 等特例。
研究者提出考虑集电路(CC),一种由多项 logit(MNL)单元构成的有向无环图定义的多阶段选择模型。在三选项折中任务上,CC 展现出显著的深度-范数分离:深度从 2 增至 3,达到误差 ε 所需的最优最大偏好向量范数从 Θ(log(1/ε)/ε) 降至 Θ(log(1/ε))。实验中,参数少于 600 的树状电路在四个固定池基准和 Expedia 时间划分上取得最低平均测试 NLL。
研究针对掩码扩散模型 tau-leaping 采样中因并行去噪引入的分解误差 ε_fact,建立了将其与调度方案及目标依赖结构分离的精确积分表示,并给出最优调度的递归平稳方程。分析显示:当依赖密度 ρ 随维度 N 增大一致收敛到严格正连续分布时,调度优化只能改善 ε_fact 的首阶常数;若 ρ 退化,则可改善渐近阶。
研究者提出 proper scoring ensemble filter(PSEF),一种仅用合成轨迹训练的集成数据同化方法,其分析步为置换等变的 transformer 映射,训练采用严格适当评分规则(实现中用 energy score)。
新工具 Express 可将非因果注意力近似转换为具有同等近似保证的因果近似,与 SOTA 的 Thinformer 结合后,在序列长度 n 下实现 log^{3/2}(n)/s 的近似误差,仅需 O(s) 内存和 O(s^2 log^2(n)) 压缩开销。
研究者提出 Flow-Transformed Implicit Processes(FTIP),用归一化流替代高斯分布来建模隐式过程先验下函数后验的组合权重,从而在保持可优化性的同时获得更灵活的函数后验分布。
研究者提出 Weighted Temporal Quantile Adjustment(W-TQA),将单位历史学到的相似度权重与自适应目标专属误覆盖率结合,用于部分观测面板中的在线共形预测。
论文提出"动作驱动过程",将随机过程与强化学习统一起来,并展示其在脉冲神经网络上的应用。借助 control-as-inference 思路,作者证明:对恰当定义的动作驱动过程,最小化策略驱动的真实分布与奖励驱动的模型分布之间的 KL 散度,等价于最大熵强化学习。
该论文对含隐藏混杂因子的线性 ODE 系统进行可辨识性分析,填补了潜变量与系统交互时可辨识条件的研究空白。研究分两种情况:潜混杂因子无因果关系但按时间 t 的多项式等函数形式演化;潜变量因果关系由 DAG 描述。作者在单/多轨迹的连续与离散观测条件下给出详细分析,并用仿真验证理论结果。
研究将推理任务的奖励建模为响应空间上的分层函数,由无穷多个局部组件构成,每个组件仅在前序组件解决后才生效。基于 Transformer 的 actor-critic 算法在采样、拟合 critic 与策略更新间交替,在查询预算和正则化强度上达到 minimax 最优速率,对固定提示词数量也最优。