用强化犹豫让语言模型学会弃权:Reinforced Hesitation 将「我不知道」变为协调信号
研究者提出 Reinforced Hesitation(RH),将 RLVR 的二值奖励改为三元奖励(+1 正确、0 弃权、-λ 错误),在逻辑谜题、MATH Levels 4-5 和医疗 QA 上训练出沿帕累托前沿分布的模型:低惩罚倾向激进作答,高惩罚倾向保守弃权。
研究者提出 Reinforced Hesitation(RH),将 RLVR 的二值奖励改为三元奖励(+1 正确、0 弃权、-λ 错误),在逻辑谜题、MATH Levels 4-5 和医疗 QA 上训练出沿帕累托前沿分布的模型:低惩罚倾向激进作答,高惩罚倾向保守弃权。
研究者提出 Physically-isolated Experts Routing Network(PiERN),一种在 token 级调度计算与推理的架构,使单条思维链内可迭代交替进行高精度数值计算与推理。
研究者提出一种直接遗憾优化方法,通过从候选模型与采集函数集合中蒸馏,联合学习最优模型与非短视采集策略,显式以最小化多步遗憾为目标。该框架用不同超参数的 Gaussian Process 集成生成模拟 BO 轨迹,训练端到端 Decision Transformer 选择下一次查询,并以少量真实评估在线精调 GP。在合成与真实基准上,其最终简单遗憾达到最佳或接近最佳,高维场景增益最大。
针对网络干扰下因果效应估计依赖"网络无混杂假设"、而观测数据中潜在混杂因子常使该假设失效的问题,研究者提出一个混杂因子恢复框架,显式刻画仅影响个体、仅影响邻居、同时影响两者三类潜在混杂因子,并基于可识别表示学习设计网络效应估计器。理论证明了三类潜在混杂因子的可识别性,并据此建立网络效应的形式化识别结果,大量实验验证了理论发现与方法的有效性。该工作已被 IEEE TPAMI 接收。
QF3 是一种在线 off-policy 强化学习算法,通过流匹配加 critic 动作梯度训练流策略,梯度经流输出的一步预测反向传播,并只对接近回放动作的维度施加 critic 梯度。
研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。
研究者提出 UNREAL,一种模型原生的证据选择框架,从冻结 LLM 的内部表示直接编码 chunk 并生成检索 query,仅新增不到 500K 可训练参数且不改动主干。
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。
研究在统一 Frenet 框架运动学模型下对比了 NMPC、PPO、PID-SF 和 Stanley 四种路径跟踪控制器,并采用含显式再生制动的 VT-CPEM 能量模型评估电动车能耗。
研究对比线性、固定循环、Transformer 与混合架构和神经进化搜索出的循环网络,在四个中盘股组合、三个交易年度上评估预测精度与日度多空策略净收益。进化网络在预测精度和净交易表现上均排第一,而精度第二的模型在建仓并计入成本后亏损;其优势来自周期匹配,rank IC 从 1 日到 10 日评分周期上升,而所有超过 300 参数的模型均下降。
研究发现低时间步深度脉冲Q网络(DSQN)的性能退化主要源于动作价值间共享的共模误差,这类误差会通过自举目标损害时序差分学习。为此提出的 CMC-DSQN 用辅助 ANN 补偿 SNN 输出的共模误差,推理时可直接从 SNN 输出做贪心动作选择并完全移除辅助 ANN,保持 SNN 能效。
APEX 是一个学习型控制器,通过请求级专家选择与块级深度自适应来平衡推测解码的速度与草稿 token 浪费。APEX-Router 为每个请求在 EAGLE-3、n-gram 和草稿模型推测之间选择,APEX-Depth 则按验证块调整草稿长度。
CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。
研究者提出 STAVE,用两个任务专属向量替代上下文示例,实现冻结大模型的任务适配。一个 readout 向量更新生成答案的 token,一个 context 向量更新其他结构 token 组,二者用带/不带示例的提示词答案标签训练。
研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。
一篇 78 页综述系统梳理了机器学习增强的迭代方法,用于求解线性与非线性方程组。这类被称为混合迭代方法的技术将经典迭代求解器与 ML 结合,在保持可解释性与可靠性的同时提升效率。文章还讨论了该方向的开放挑战与未来研究路径。
研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。
针对 LLM 从单轮补全转向智能体轨迹后推理硬件经济性的变化,论文用 roofline 分析和闭式 episode 延迟模型指出,智能体轨迹顺序依赖、有效 batch 为 1。
研究者提出 Hierarchy-GBP(H-GBP),一个两阶段迭代框架,先用粗化图近似(抽象)解决全局误差并投影回原图(恢复),再用 GBP 精修局部误差,并通过推导组合矩阵算子及谱半径分析证明了收敛性。
AdaLoop 是一种轻量级循环模块,能让音频语言模型根据音频-问题对自动学习所需的潜在精炼步数,通过共享 transformer 块在问题引导下迭代音频表示,并由学习到的停止机制决定退出时机。
一项针对四旋翼飞行控制的研究对比了从无风、离散 1-cosine 阵风、统计湍流、合成相干结构到大气边界层大涡模拟场的五种扰动保真度,在全交叉训练-测试矩阵中评估 PPO 智能体,并以级联 PID 和几何 SE(3) 控制器作为免训练参照,风速扫描范围 0-12 m/s。
研究为 Conformal Prediction 的预测集大小作为不确定性度量提供了信息论基础,提出基于预测集大小与覆盖率的广义信息度量族,并证明 Shannon 互信息可由该族精确积分表示。
研究者提出 Neural Petri Flow(NPF),将 Petri 网的守恒性与非负性硬编码为无参数层,仅学习各变迁的速率律,使原子映射、反应分类与前向预测统一为同一 firing 向量上的任务。
研究精确滑动窗口约束下的线性 bandit:离线场景下凸性与循环平移不变性使平稳解在 w∣T 时最优,否则存在 O(w) 加性差距;在线场景仅靠几何结构不足以学习,甚至可能无法实现次线性 regret。作者引入转移直径 τ 与稀有切换 OFUL 算法,regret 为 Õ(d√T+τd+w),并在去除循环不变性后引入历史状态直径 D,取得 Õ(d√T+dD+w) 的 regret 界。
研究提出统一概率框架,将 GP 预测器与显式外生噪声机制配对,为二元、名义和有序离散结果分别推导精确的条件噪声反演方法,并证明其能复现拟合模型的观测与干预分布。在合成 SCM 上,对有序数据误用分类耦合会使反事实误差膨胀约三倍,且该误差不随数据量增加而下降。
一项研究在 ARC-TGI 基准上对 decoder-only、encoder-decoder 和 MoE 三类小语言模型进行了超 1000 次监督微调实验,发现模型虽能达到较高的分布内准确率,但技能习得对优化敏感且在各任务族间分布不均。
针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。
CNet 是一个基于 C++/CUDA 的复数神经网络框架,用 Wirtinger 微积分做梯度下降,分类采用 Born 规则测量 p_k = |z_k|² / ‖z‖² 而非 softmax。
研究者提出即插即用的随机傅里叶特征高斯过程注意力模块 RFF-GPA,将注意力表示为用随机傅里叶特征近似平稳核的高斯过程,把后验均值与方差的近似复杂度降到序列长度的线性级。在多个真实数据集上,该模块在保持预测精度的同时改善了校准表现。
研究首次对 TabICL 免训练图节点分类做保形可靠性分析,以每张图一半节点为标注上下文,冻结的上下文预测器使 split conformal prediction 在有限样本下精确有效。
研究提出 Prefix-State Hybrid Block Attention(PHBA),用 top-k 块稀疏检索替代固定局部滑动窗口注意力,并将每个检索块与其前缀状态配对,前缀状态由块边界处的门控线性递归构建。
研究者提出 Sparse Segment Reduction(SSR),一种针对三值 LLM 与三值权重网络(TWN)推理的三值矩阵乘法方法,通过专用三值数据格式和随稀疏度扩展的计算树利用稀疏结构。
VETTA 通过共享轻量 critic 上的独立价值头,联合学习回合级与 token 级信用,并将回合优势与响应内中心化的 token 残差结合用于 PPO 更新。
研究提出用占用度量(occupancy measure)将 MDP 重构为线性规划(LP),通过 pivoting 算法识别可行多面体的活跃约束,推导出闭式梯度,替代依赖 Bellman 方程 KKT 条件、需在全状态-动作对上求解线性系统的方法。
研究提出结构感知图弃权方法,将实例级可信度与变量间关系一致性视为两条独立可靠性轴,通过可学习稀疏图和 Dirichlet 式结构能量 E_struct 实现后者,并用误差加权图正则化与分数-误差对齐训练。在七个长时程基准和四个骨干模型上,结构门控在相同覆盖率下常比 TEM 降低选择性 MSE,跨变量结构信息更丰富时增益最大,但增益并非普遍存在。
研究在线性函数逼近下用分段奖励反馈替代逐状态-动作奖励的强化学习。针对等长分段,作者提出 $\bitssegd$、$\edlinucbsegd$ 及统一 $\seglsvits$ 框架,并给出近匹配下界;二元反馈下增加分段数可指数级降低 regret,而求和反馈下分段粒度影响不大。允许任意分段的 $\uneqsegbitsd$ 表明等长分段性能最佳。
研究因果验证了语言模型识别网络基础设施信息(主机名与IP地址配对)的注意力头:在三个架构家族的五个模型中,每个模型仅需1至9个注意力头(候选128至1152个)即可支撑检测器达到99.5–100%的留出准确率。
研究者提出无训练两阶段闭式框架,通过 Fisher 加权非对称对齐与秩约束自然梯度校正,改进极低比特量化大语言模型的低秩误差补偿。在 QuIP# 2-bit 下,该方法将 Qwen3-8B 的 WikiText-2 困惑度从 12.43 降至 10.26,Qwen3-4B 从 21.11 降至 13.22。
研究者提出 Mu-DisCoCat,一个面向 DisCoCat 的多模态变分量子学习框架,用于实现组合概念泛化(CoCoGen)。该框架先从单物体图文对学习稳定的物体表示,再固定这些表示学习多物体场景中的关系;经典模拟中使用 Uhlmann 态保真度计算多模态电路表示的重叠,关系 OOD 准确率高于所评估的 CLIP 基线。