外部引导何时帮助 LLM 推理?引导增强 GRPO 的偏差-方差理论
研究者提出 Guidance-Augmented GRPO(GA-GRPO)统一理论框架,将外部引导建模为改写问题分布的随机引导算子 G,并把策略梯度估计量分析为偏差受引导散度 delta_G 约束的 on-policy 估计量,可涵盖 GRPO、LUFFY、ExPO、PAPO、TAPO 等特例。
研究者提出 Guidance-Augmented GRPO(GA-GRPO)统一理论框架,将外部引导建模为改写问题分布的随机引导算子 G,并把策略梯度估计量分析为偏差受引导散度 delta_G 约束的 on-policy 估计量,可涵盖 GRPO、LUFFY、ExPO、PAPO、TAPO 等特例。
TEMPEST 是一种用 ArcFace 角度间隔损失训练的时间卷积网络嵌入模型,将 60 秒多模态驾驶窗口映射为 96 维嵌入,支持无需重训练的动态注册。在 45 名驾驶员的时序评测中,它取得 91.71% Rank-1 准确率,比最强 triplet-loss 基线高 58.4 个百分点;驾驶员池从 10 增至 45 时性能仅下降 4.3 个百分点。
研究者提出 Grand Canonical Generators(GCG),将 Boltzmann 生成器扩展到巨正则系综,并给出两种设计:一种以化学势为条件联合采样粒子数与构型,另一种将巨正则分布分解为粒子数分布与对应正则 Boltzmann 密度。
论文刻画了固定设计下固定规模体积采样配合无权最小二乘何时达到其系数协方差上界:对无共线列的白化设计,接触空间在每个严格内点样本量下保持不变,其非零值构成有限正交族。研究给出全样本量的留一协方差亏缺比较、查询风险上下界及精确构造,并证明同一残差可精确达到整个查询当且仅当查询范围落在某一类空间内。
一项审计发现,GNN 在常用时空预测基准上的表现并不一致,重新评估时间线性基线后,GNN 在多个基准上的增益大幅缩水,在部分基准上甚至被线性基线超越。为 GNN 提供自回归残差可提升其表现,尤其在非交通类基准上;合成实验显示 GNN 对时间动态与空间图交互的异质性较为敏感。
QUASAR 是一种量化感知训练(QAT)方法,通过将轻量级损失感知重建引入训练循环,在每步训练中搜索少量 clipping 范围并用显著性加权最小二乘拟合反量化参数,从而收紧 QAT 的收敛与最终损失界。
针对协方差矩阵、核矩阵、MIMO 信道矩阵等本质为谱而非坐标向量的数据,逐坐标加噪的扩散模型会收敛到错误极限,因为特征值相互排斥而非独立运动。研究者提出状态依赖的自由波动率,通过闭式 Hilbert 变换漂移,为任意足够正则的紧支撑目标分布显式构造以该分布为平稳谱分布的自由 Fokker-Planck 流,突破了常系数自由扩散只能收敛到半圆律的限制。
研究提出一种基于谱的无监督表示学习框架,从电子健康记录中为罕见病队列的临床概念和患者学习低维嵌入,通过引入来自更广泛人群的知识矩阵缓解高维小样本问题。该方法放宽了潜在数据矩阵与知识矩阵间严格的一对一信号对齐假设,采用两步谱嵌入:先剔除知识矩阵中的无关成分,再以投影方法分别恢复共享与异质成分。仿真和真实多发性硬化症队列分析显示,在共享信号微弱且仅部分对齐的困难场景下,该方法优于对比方法。
一篇被 IEEE TPAMI 接收的综述从自相关建模视角系统梳理了深度时间序列预测,指出该领域两大核心挑战是设计骨干架构建模历史序列自相关、设计损失函数建模标签序列自相关。该综述提出同时覆盖骨干架构与损失函数的分类体系,弥补了此前综述对损失函数覆盖不足的空白,并从统一的自相关视角分析文献动机与洞见。
研究者提出基于核化 Stein 差异(SKSD)的半参数拟合优度检验,并设计了一种无需重新拟合模型或从中采样的影响调整 wild bootstrap,用于构造 level-α 检验。该检验在经典正态性检验到难解似然模型的模拟中,以低数个数量级的计算成本取得相当或更优的检验功效,并已用于评估肺腺癌反向蛋白阵列数据的蛋白信号网络模型。
针对 Mixup 数据增强中"鲁棒性提升但校准误差(ECE)显著增大"的权衡问题,研究者提出 DRO-Augment,将 Wasserstein 分布鲁棒优化(W-DRO)与多种 Mixup 策略结合,在 CIFAR-10、CIFAR-100、CIFAR-10-C 和 CIFAR-100-C 上大幅降低 ECE,同时基本保持损坏数据准确率。
该论文对含隐藏混杂因子的线性 ODE 系统进行可辨识性分析,填补了潜变量与系统交互时可辨识条件的研究空白。研究分两种情况:潜混杂因子无因果关系但按时间 t 的多项式等函数形式演化;潜变量因果关系由 DAG 描述。作者在单/多轨迹的连续与离散观测条件下给出详细分析,并用仿真验证理论结果。
研究者提出一种面向时空场景的预测驱动推断方法,在仅有短期带标签时间序列、较长无标签时间序列和不完美预测器的条件下,为各空间位置的未来期望标签提供可靠点估计与置信区间。该方法针对 PPI 的 i.i.d. 假设在时间依赖下失效的问题,结合 HAC 程序处理时序相关性,实验显示其优于自然替代方案。该工作已被 NeurIPS 2026 TS-LIMITS Workshop 接收。
研究从含噪高维数据生成的随机几何图中恢复低维潜在几何结构的问题,分析了 Signal+Noise Graph Model 上谱嵌入算法的性能。在点数 n 与环境维度 d 均趋于无穷的高维情形下,证明在谱间隙条件下,图邻接矩阵的顶部特征向量和特征值可将点云近似恢复到正交变换以内。结果在嵌套球面和高维正弦曲线采样的点云上得到验证。
研究者将 L 个 Hopfield 模型通过 Hebbian 模块内耦合与 anti-Hebbian 模块间耦合组成模块化联想网络,其积分表示对应 L 个隐藏层相互耦合的受限玻尔兹曼机(RBM),从而把 HM-RBM 对偶推广到模块化场景。
研究将推理任务的奖励建模为响应空间上的分层函数,由无穷多个局部组件构成,每个组件仅在前序组件解决后才生效。基于 Transformer 的 actor-critic 算法在采样、拟合 critic 与策略更新间交替,在查询预算和正则化强度上达到 minimax 最优速率,对固定提示词数量也最优。
针对 log-vMEM 模型参数随维度和滞后阶数快速增长的问题,该研究引入分层滞后结构进行正则化估计,并采用分块坐标下降算法配合 Gauss-Seidel 式更新方案。
研究证明对称感知与对称无关特征学习间存在多项式样本复杂度分离。在秩增长的多指标模型中,权重共享架构与全群数据增强均以 Õ(d^{p-1}) 样本实现弱方向恢复,而对称无关学习需 Õ(rd^{p-1});纯二次 Hermite 链接下对应复杂度为 Õ(d) 与 Õ(rd)。全群数据增强与架构权重共享样本效率相当,均优于无对称训练。
研究在 1.375 亿行的 Trendyol 排序特征表上评测五种多列双样本漂移检测方法,发现基于 Apache Spark 的分布式最大均值差异(MMD)配合 Random Fourier Features 表现最稳健,在强漂移区间与预期漂移幅度的 Pearson 相关系数达 r = 0.940,真阳性率 80.4%,假阳性率 3.2%。
研究将数据源间均值偏移的移除建模为统计决策问题,推导出在硬失真预算下学习单一线性映射的精确有限样本极小极大风险为 (d-k)E[1/(d+2J)],其中 J~Pois(κ/2),k 为可删除方向数,κ 为校准信噪比。
研究揭示 Prior Fitted Networks(PFN)如 TabPFN 在位置估计任务中实现统计自适应的机制:softmax 注意力在标量输入上计算经验累积生成函数的导数,同时提供区分数据族的特征并形成在样本均值与中程之间插值的估计器。
一项理论研究证明,在多个高斯混合分类任务上对抗预训练的足够深的线性 Transformer,可通过干净示例的上下文学习,在未见任务上渐近达到鲁棒贝叶斯误差,而标准训练的模型做不到。研究还分析了梯度流下的收敛性、精度与鲁棒性的权衡以及示例复杂度。
研究从固定设计的恰好 s 个不同行进行岭回归,响应固定而仅子集随机,证明当 s 超过目标有效维度时,存在唯一惩罚项使所选岭回归拟合在期望上匹配全数据岭回归拟合。针对平衡符号坐标副本,严格扇区不等式给出从维度到行数减一各预算下的锐利风险及全部最大化响应,并构造出同样本无偏的岭—Horvitz—Thompson 混合估计,具有更低锐利风险与精确均值份额改进边界。
针对 entry-wise i.i.d. 对称 α-stable 重尾数据下的线性回归经验风险最小化,研究引入函数型序参量刻画每个系数对应的随机有效问题,并用复本方法完整刻画了样本量与特征维度按固定比例发散的高维极限下的泛化误差。该分析还建立了重尾普适性定律、典型误差与预测可靠性之间的 scaling law,以及 Bayes 最优预测误差。
数据同化(DA)通过将模型预报与观测结合来最优估计系统状态,对大气等混沌系统至关重要,全球业务预报中心通常每 6 小时执行一次。这篇 13 页综述讨论了机器学习(ML)与 DA 交叉这一新兴且快速发展的领域,概述了其中的主要课题与方法。
研究提出用 n-聚合归一化流链做仿真推断中的似然近似,前向复杂仿真模型的多组复制观测数据依次通过多组双射变换,前 k 组变换的参数按最优性顺序估计,不受其余 n-k 组影响。该框架通过经验似然估计与带混合分布的序贯决策两条数学路径更新和聚合归一化流参数,并附带一个以正向仿真参数为条件的代理模型,支持样本生成及贝叶斯范式下的推断、假设检验与不确定性量化。
研究者提出一种基于 Blackwell 序的多变量高斯系统部分信息分解(PID)方法,证明高斯信道在提取冗余信息和并集信息时均为最优,并给出直观的几何解释与高效数值算法。其并集信息与协同信息同 BROJA 度量一致,并推导出双信源下的闭式解;该方法可扩展到上千维或上千信源的系统,并在一个最优控制问题中识别出传感器与记忆之间的冗余和协同交互。
研究者提出 Hierarchical Spectral Shrinkage(HSS),一个可扩展的 empirical-Bayes 框架,用于对任务特定的谱估计量进行部分池化。该方法将各任务的主导谱方向向数据自适应学习到的公共基正则化,并允许收缩程度随任务和谱分量变化。在合成实验和多研究基因表达数据上,HSS 在估计精度和样本外表现上均优于独立估计、完全池化和共享子空间方法。
研究者提出一种基于流匹配的算法,在保持马尔可夫结构的前提下学习从源分布到目标轨迹分布的传输映射,并证明了其在总体极限下的一致性,在混合时间假设下给出了有限样本误差界。在 THINGS-EEG2 的 EEG 图像检索任务上,该方法为 ENIGMA 解码器在受试者特定时间映射前加入条件流,将平均 top-5 检索准确率从 43.87% 提升至 49.05%,相对提升 11.82%。
一项理论研究为多语言语言模型中层跨语言表示相似性现象提供了理论解释。研究者用共享上层但下层产生式规则不同的概率上下文无关文法生成合成语言,证明贝叶斯最优下一 token 预测器即信念传播(BP),将其消息编码进连续层所得解析预测与在同数据上训练的 Transformer 高度吻合。
研究者提出 ALCATRAs 框架,在标注阶段按预算选择性采集辅助信息、部署阶段则无法获取这类信息,以解决由此产生的"设计性缺失"问题。该框架由任务选择策略与代理学习程序两部分组成,理论上可改善预测误差界。仿真实验与 UCI 心脏病队列应用显示,其样本效率优于基线方法。
研究提出监督回归中统计特征学习的几何框架,通过底-纤维分解定义特征学习,并证明球形平均场 Langevin 动力学具备该性质。在高斯多指标模型中,低温平稳分布集中于隐藏指标附近形成多尖峰结构,在温度 λ≍1 处发生急剧转变,并实现高概率参数恢复。高斯单指标模型的平稳测度则依奇偶性分别落在 S₂^{d-1} 或 ℝP^{d-1} 上,学习到的特征空间对齐回归信号,收敛速率为 d/N 与 Md/N。
研究者提出 DireSMC,一种序列蒙特卡洛方案,通过引导带权样本群体逼近稀有事件,同时给出该事件概率的校准估计。该方法在基于分数模型的气候模拟器上,对 10^-3 至 10^-5 的稀有事件概率取得准确结果,相比蒙特卡洛实现 9 倍至 1413 倍的净加速。
研究者提出一种算法控制的随机合成方法,通过设计并合成复杂混合物、以池为单位测试后再解卷积分子-活性图谱,从而高效搜索大范围分子空间。理论上可将从 d 个候选分子中找到最优分子所需的实验次数从 O(d) 降至 O(log d) 或 O(1),在模拟的蛋白质适应度景观上比现有贝叶斯优化方法少一个数量级实验即可找到活性分子。
研究者提出一种基于生成式传输的两样本检验方法:直接在两个样本间构建随机插值,利用对称调度下时间反射 t↦1-t 的分布不变性,通过计算 t 与 1-t 时刻边缘分布的 Jensen-Shannon 散度来判断两组样本是否同分布。该方法无需学习、通过置换校准获得精确有限样本水平,在窄加宽噪声设计下达到极小极大分离率 n^{-2s/(4s+d)},实验表现匹配或优于 SOTA 核两样本检验。
针对空间自相关导致相邻像素信息冗余、样本量被高估的问题,研究证明 n×n 图像在相关范围为 r 像素时有效样本量为 Θ(n²/r²) 而非 n²,并给出紧致下界表明无算法能更优。
针对隐藏混杂下近端因果推断需求解病态积分方程、对数据量和超参数敏感的问题,研究者提出 ProximalFM,用 prior-data fitted networks(PFNs)将贝叶斯算子反演摊销为单次 Transformer 前向传播,直接建模 CATE 的贝叶斯后验分布。
研究证明,固定时间尺度比与非递增步长的双时间尺度 SGDA 在非凸-PL 博弈中复杂度下界为 Ω(κ²ℓε⁻²+κ⁴ℓσ²ε⁻⁴),与现有 SGDA 上界吻合,并与 Smoothed-AGDA 形成复杂度分离。当时间尺度比小至 o(κ²) 时,SGDA 甚至无法找到稳定点,凸显其在 NC-PL 博弈中的根本局限。
研究将 LLM 评委的评测机制近似为一类 Markov GLMM,并在三个主流商用 LLM 上通过样本外预测验证。基于一阶 Markov GLMM 的分析显示,随机化提示词顺序再取平均的排行榜选择在温和分离条件下具有一致性,Williams 方设计可在项目质量接近时提升效率;而分组比较中,由于响应模型的非线性,简单平均可能得出关于组间质量差异的不一致结论。
针对梯度 EM 在过参数化设置下学习高斯混合模型需真值分量分离度达到 Ω(√d) 的已知结论,该论文证明这一维度依赖在高维下不可避免。作者考虑对混合权重用标准 EM、对分量均值用梯度 EM 的混合算法,证明当维度足够大时,即便在过参数化情形下,Ω(d^{0.5-ε}) 量级的分离度也不足以在次指数时间内保证随机初始化下总体梯度 EM 的全局收敛,从而给出近乎最优的最坏情况下界。