自我监控的测试时自适应为何失效:多步时间序列预测中的可交换性假设崩塌
多步时间序列预测中,当监控与自适应共用同一预测误差反馈时,重叠目标与误差依赖会破坏监控统计保证所依赖的关键假设,导致无有害变化时也触发警报并进一步损害预测质量。研究还发现自适应会把持续性变化从自身监控中隐藏,而原始冻结模型反而保留更清晰的信号。
多步时间序列预测中,当监控与自适应共用同一预测误差反馈时,重叠目标与误差依赖会破坏监控统计保证所依赖的关键假设,导致无有害变化时也触发警报并进一步损害预测质量。研究还发现自适应会把持续性变化从自身监控中隐藏,而原始冻结模型反而保留更清晰的信号。
针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。
研究者提出 DireSMC,一种序列蒙特卡洛方案,通过引导带权样本群体逼近稀有事件,同时给出该事件概率的校准估计。该方法在基于分数模型的气候模拟器上,对 10^-3 至 10^-5 的稀有事件概率取得准确结果,相比蒙特卡洛实现 9 倍至 1413 倍的净加速。
研究者提出一套针对稀疏支持向量机(SVM)的高维统计推断框架,在样本量与特征数成比例增长时,通过将 L1 惩罚 SVM 表示为线性规划并借助对偶变量识别 hinge 损失次梯度,得到坐标渐近高斯的去偏估计量。该方法可给出单个特征的置信区间与假设检验,并实现错误发现率受控的变量选择,在强相关协方差结构下的模拟及高维乳腺癌基因表达数据分析中验证了校准、功效与变量选择表现。
针对隐藏混杂下近端因果推断需求解病态积分方程、对数据量和超参数敏感的问题,研究者提出 ProximalFM,用 prior-data fitted networks(PFNs)将贝叶斯算子反演摊销为单次 Transformer 前向传播,直接建模 CATE 的贝叶斯后验分布。
研究者提出一种基于调和权重的在线校准算法,对 d 个二值结果同时预测(Y=[0,1]^d)可在 d^{O(1/ε)} 轮内实现 ε-校准,将维度依赖从指数级降至多项式级。该方法对多分类预测(Y=Δ_d)同样达到 d^{O(1/ε)} 速率,优于此前 d^{Õ(1/ε²)} 的界。算法每轮输出过去结果的调和加权分布,其权重源于离散 Hilbert 变换矩阵在任意 L 范数下达到最优差异度。
研究针对以累积奖励几何平均衡量的 Nash 社会福利(NSW)目标,提出轨迹级 Nash 遗憾,先对完整样本路径取几何平均再求期望,比原有指标更严格。同时给出首个高概率 Nash 遗憾界,其两阶段算法 RR-NCB 结合轮询探索与 Nash 置信界索引策略,达到 Õ(√(k/T)) 的最优速率。该工作已被 NeurIPS 2026 接收。
一项数学研究证明,Transformer 将亚高斯输入映射为亚高斯输出,从而保证任意长度 softmax 算子复合的良定义性。研究进一步证明 Transformer 关于 1-Wasserstein 距离满足 Hölder 连续性,并据此给出亚高斯输入与其经验近似之间沿 Transformer 的误差传播估计。
针对均匀离散扩散模型,研究者证明在 $[K]^d$ 上从 $n$ 个 i.i.d. 样本估计未知分布 $P_0$ 时,期望 TV 损失以 $O(\sqrt{s_n(P_0)/n})$ 缩放,KL 散度上界为 $O(\frac{1}{n}s_n(P_0)\log(eK^d/s_n(P_0))\log n)$,其中 $s_n(P_0)$ 为有效支撑集大小。
研究者为序贯校准问题给出首个显式低于 2/3 的指数界 O(T^{0.662942288})。方法上提出两阶段递归标注策略,为 sign-preservation-with-reuse 博弈给出 O(n^α t^β) 界,并改进 Dagan 等人的归约,仅用 O(log T) 次该博弈实例即可从符号保持上界推出校准上界。
研究者提出 ORUCB,在在线学习延迟(online learning to defer)场景中,让学习器在购买专家答案前先固定一个修正函数,再对收到的答案应用该函数。该方法通过池化共享与专家专属的多项式响应,在固定问题参数下实现高概率伪遗憾 O(√T log(T+1))。在四个测试流上,所选三次策略的费用包含成本低于七个直接使用原始答案的基线。
研究用两参数 softmax-attention 模型分析基于梯度的预训练如何学习决策阈值:在大分辨率初始化下,对 m 个任务(每个 n 个样本)做恒定步长梯度下降,可得到误差为 Õ((m∧n)⁻¹+N⁻¹) 的冻结估计器,两项分别对应有限预训练精度与新上下文定位。
sHAIL-Causal 是 sHAIL 学习框架的因果特化版本,通过拟合优度饱和与跨环境不变性的联合准则,沿嵌套假设类 H_0 < H_1 < ... < H_K 逐级上升,替代结构风险最小化的复杂度控制。
研究者提出 Memory Prediction Excess(MPE),用于量化离散时间有限状态过程中,使用全部历史相比仅用静态边缘分布所带来的预测准确率平均提升。MPE 恒为非负,其上限取决于静态准确率,并给出归一化版本与有限历史 MPE(FH-MPE),据此定义达到全历史预测性能所需的最小记忆长度;对有限阶马尔可夫链,该长度被证明不超过马尔可夫阶数。
研究者提出 E$^2$-OPSD,用于解决在线策略自蒸馏(OPSD)中"熵过冲"的失败模式:学生 token 熵超过教师并持续偏高。该方法用检索到的已解邻近问题替代当前答案进行示例引导教学,并依据学生-教师熵差决定每个 token 的修正方向与强度。
研究者提出 Sparse Asymmetric Group-Query Attention(SAGA),将 key 头与 value 头数量解耦,并搭配近似 top-N(Atop-N)稀疏注意力。
研究针对 Mamba2 等选择性 SSM 在分布式学习中缺乏架构感知理论的问题,推导了单层与多层选择性 SSM 的梯度与平滑性边界,以及 FedAvg 和 FedProx 的收敛边界,刻画循环稳定性、输入相关离散化和状态投影范数对联邦优化的影响。作者在教师 SSM 生成的序列上数值验证了单层边界,并在六个文本域上对比九种联邦学习算法用于 Mamba2 语言建模。
一项受控实验用 30 个工件、150 个植入错误、10 种审查条件和 900 次审查会话,测试了来自两家开发商的三个审查模型。顶级跨模型审查者的 F1 与同模型新会话审查(CCR)无显著差异,但两者发现的错误仅部分重叠(Jaccard 41.2%)。
论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。
研究者提出由 AI 开发的局部红外减除框架,在人类物理指导下由 LLM 给出两种实现:一种用神经网络做相空间投影并拟合 Born contact,另一种用解析构造直接计算 contact 项,无需切片参数。
KernelOPT 是一个多智能体系统,将编译后的模型视为结构化产物,保留 cuBLAS、cuDNN 等厂商库调用,仅针对生成的 Triton 子 kernel,由五个 profiling 引导的 LLM 智能体进行优化。
ValueDiff 是一种基于值几何的 KV cache 淘汰方法,按 value 向量与缓存均值的 L2 偏差对 token 排序,在弱注意力汇模型上替代依赖注意力汇的既有方案。
研究者提出基于局部掩码 SAE 的无监督异常检测框架,利用线性表示假设下邻近点共享小共同活跃支撑的特性,在多种架构和数据集上验证了 LLM 安全检测的可行性。当允许使用 1% 的分布外数据校准时,该方法达到接近最优的性能,且仅需 1-2% 的 SAE 神经元参与计算。该工作发表于 NeurIPS2026。
研究者提出 Causal Semantic World Action Model(CSWAM),在 FastWAM 基础上引入基于 V-JEPA 2.1 的因果语义专家,通过因果注意力将历史语义上下文共享给视频与动作流,推理时仅需当前视频状态和语义历史即可完成动作去噪。
SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。
PertMind 将细胞扰动图谱转化为强化学习环境,以实测基因响应作为可计算奖励,结合可信轨迹监督初始化与基因、通路、格式三级强化信号。该模型仅在正向扰动响应预测上训练,却在未见细胞环境中提升响应推断,并零样本迁移至反向扰动识别、双扰动推理、表型筛选优先级排序和生物过程解读。
研究提出一个受控基准,用有序规划操作刻画 LLM 智能体在信息物理系统中的控制轨迹,由 Llama-3.3-70B 在 40 个产消者的辐射状馈线上执行需求响应实验。
研究基于合成基准 SBID-FD,将已知含冲突的段落分为 11 类不一致类型,并对比冻结编码器、微调编码器、证据增强分类器、提示式大语言模型与 LoRA 适配生成模型。结果显示任务特定适配显著优于冻结表示,微调后的 300M 编码器可与更大规模的提示与适配模型竞争。自动提取的证据能提供额外信号,但仅能恢复参考跨度带来的部分收益。
研究者提出 Variational-Ising-Attention(VIA),在 softmax 归一化基础上引入相互作用 Ising 模型,通过变分平均场推断从可学习的成对耦合中生成注意力模式,将注意力从孤立项的排序扩展为相互作用实体的集体状态。
Guided Action Flow(GAF)通过从机器人任务 rollout 中学习紧凑的观测条件动作价值 critic,并用其动作梯度引导反向流采样,使监督微调后的 VLA 策略保持冻结。
研究者提出 Prime Fourier Embeddings(PFE),将整数编码为素数索引的 (cos, sin) 对,使模运算只需选择相关素数通道。基于 Schur 引理,作者证明任何对乘积群作用等变的线性映射必为块对角结构,每个素数对应一个独立块;中国剩余定理可预测无平方因子合数模的任务相关通道。
研究者提出用程序合成近似 Transformer 注意力头行为的方法:先计算注意力矩阵,再让预训练语言模型据此生成 Python 程序,最后按留出输入上的预测效果重排序。
研究者提出 support-conditioned control-sensitivity regularization,通过促进训练充分区域的局部响应性来保留控制引发的状态变化,解决学习动力学对控制不敏感、掩盖 OOD 信号的问题。该方法在视觉避障、操作和真实机器人导航实验中提升了 OOD 检测能力与闭环规划安全性,论文已被 CoRL 2026 接收。
研究揭示推理训练语言模型在数千至数十万候选标签中做多标签选择时,依赖一组小型、全局、分阶段的注意力头,在 MIMIC-IV 临床编码任务(5,651 个诊断码全部入上下文)中经消融与 knock-in 验证为必要且充分。作者提出 MISTILL,在决策事件处额外监督学生模型的池化注意力,跨家族学生对比决策的因果恢复近乎翻倍。
研究提出终端表示(TR),一种结构上区别于后继表示(SR)和默认表示(DR)的新型强化学习表示方法。TR 与 DR 一样编码奖励加权轨迹,但可作为更低维对象学习,且无需特征分解即可直接用于选项发现、奖励塑形、迁移学习和探索等任务,同时绕开对称转移动态假设。
研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过联合评估同一输入下多次预测形成的经验预测分布,并按留一法贡献为每个预测分配奖励。在合成插值/外推任务及代码、分子两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习降低了预测误差、提升了排序质量,并给出校准更好的不确定性估计。
研究者提出 Residual Latent Action(RLA),可从 DINO 残差中学习,并据此构建 RLA-WM 世界模型,通过 flow matching 预测 RLA 值。
一项研究分析了 Transformer 中双随机注意力的秩衰减问题,发现用 Sinkhorn 算法归一化的双随机注意力矩阵比标准 softmax 行随机注意力更能有效保持秩,且残差连接对缓解秩崩溃至关重要。该现象在情感分析和图像分类任务上得到实证验证,理论上推导出纯自注意力下秩随深度双重指数衰减至 1 的界。
研究提出"道德推理轨迹"概念,追踪 LLM 中间推理步骤中伦理框架的调用序列,在六个模型和三个基准上发现 55.4–57.7% 的连续步骤发生框架切换,仅 16.4–17.8% 的轨迹保持框架一致。
PC-Diffuser 是一种安全增强框架,将可认证、路径一致的障碍函数结构直接嵌入扩散规划的每一步去噪循环中。它用胶囊距离障碍函数评估碰撞风险以更好反映车辆几何、减少不必要的保守性,并通过运动学自行车模型把去噪路点转为动态可行运动,再施加路径一致安全过滤器消除残余约束违反且不产生几何畸变。