Robust Async-Fed-Q:面向不可靠轨迹的对抗鲁棒联邦 Q-Learning
研究团队提出 Robust Async-Fed-Q,一种基于 epoch 的联邦强化学习算法,在智能体端对 Bellman 最优算子做方差缩减估计、在服务器端做鲁棒聚合,使部分智能体发送任意损坏信息时仍能保留协作的样本效率收益。
研究团队提出 Robust Async-Fed-Q,一种基于 epoch 的联邦强化学习算法,在智能体端对 Bellman 最优算子做方差缩减估计、在服务器端做鲁棒聚合,使部分智能体发送任意损坏信息时仍能保留协作的样本效率收益。
亚马逊与汽车制造业合作运行的事件驱动云基础设施,三年来调度 40000+ 次生产训练任务,训练物理预测模型与强化学习控制策略的专用模型对,相比常开 GPU 基础设施降低 72-78% 成本。
研究者提出 Guidance-Augmented GRPO(GA-GRPO)统一理论框架,将外部引导建模为改写问题分布的随机引导算子 G,并把策略梯度估计量分析为偏差受引导散度 delta_G 约束的 on-policy 估计量,可涵盖 GRPO、LUFFY、ExPO、PAPO、TAPO 等特例。
TEMPEST 是一种用 ArcFace 角度间隔损失训练的时间卷积网络嵌入模型,将 60 秒多模态驾驶窗口映射为 96 维嵌入,支持无需重训练的动态注册。在 45 名驾驶员的时序评测中,它取得 91.71% Rank-1 准确率,比最强 triplet-loss 基线高 58.4 个百分点;驾驶员池从 10 增至 45 时性能仅下降 4.3 个百分点。
研究者提出考虑集电路(CC),一种由多项 logit(MNL)单元构成的有向无环图定义的多阶段选择模型。在三选项折中任务上,CC 展现出显著的深度-范数分离:深度从 2 增至 3,达到误差 ε 所需的最优最大偏好向量范数从 Θ(log(1/ε)/ε) 降至 Θ(log(1/ε))。实验中,参数少于 600 的树状电路在四个固定池基准和 Expedia 时间划分上取得最低平均测试 NLL。
研究者提出 Grand Canonical Generators(GCG),将 Boltzmann 生成器扩展到巨正则系综,并给出两种设计:一种以化学势为条件联合采样粒子数与构型,另一种将巨正则分布分解为粒子数分布与对应正则 Boltzmann 密度。
研究针对掩码扩散模型 tau-leaping 采样中因并行去噪引入的分解误差 ε_fact,建立了将其与调度方案及目标依赖结构分离的精确积分表示,并给出最优调度的递归平稳方程。分析显示:当依赖密度 ρ 随维度 N 增大一致收敛到严格正连续分布时,调度优化只能改善 ε_fact 的首阶常数;若 ρ 退化,则可改善渐近阶。
论文刻画了固定设计下固定规模体积采样配合无权最小二乘何时达到其系数协方差上界:对无共线列的白化设计,接触空间在每个严格内点样本量下保持不变,其非零值构成有限正交族。研究给出全样本量的留一协方差亏缺比较、查询风险上下界及精确构造,并证明同一残差可精确达到整个查询当且仅当查询范围落在某一类空间内。
一项审计发现,GNN 在常用时空预测基准上的表现并不一致,重新评估时间线性基线后,GNN 在多个基准上的增益大幅缩水,在部分基准上甚至被线性基线超越。为 GNN 提供自回归残差可提升其表现,尤其在非交通类基准上;合成实验显示 GNN 对时间动态与空间图交互的异质性较为敏感。
QUASAR 是一种量化感知训练(QAT)方法,通过将轻量级损失感知重建引入训练循环,在每步训练中搜索少量 clipping 范围并用显著性加权最小二乘拟合反量化参数,从而收紧 QAT 的收敛与最终损失界。
研究者提出 proper scoring ensemble filter(PSEF),一种仅用合成轨迹训练的集成数据同化方法,其分析步为置换等变的 transformer 映射,训练采用严格适当评分规则(实现中用 energy score)。
新工具 Express 可将非因果注意力近似转换为具有同等近似保证的因果近似,与 SOTA 的 Thinformer 结合后,在序列长度 n 下实现 log^{3/2}(n)/s 的近似误差,仅需 O(s) 内存和 O(s^2 log^2(n)) 压缩开销。
研究者提出 Flow-Transformed Implicit Processes(FTIP),用归一化流替代高斯分布来建模隐式过程先验下函数后验的组合权重,从而在保持可优化性的同时获得更灵活的函数后验分布。
针对协方差矩阵、核矩阵、MIMO 信道矩阵等本质为谱而非坐标向量的数据,逐坐标加噪的扩散模型会收敛到错误极限,因为特征值相互排斥而非独立运动。研究者提出状态依赖的自由波动率,通过闭式 Hilbert 变换漂移,为任意足够正则的紧支撑目标分布显式构造以该分布为平稳谱分布的自由 Fokker-Planck 流,突破了常系数自由扩散只能收敛到半圆律的限制。
研究提出一种基于谱的无监督表示学习框架,从电子健康记录中为罕见病队列的临床概念和患者学习低维嵌入,通过引入来自更广泛人群的知识矩阵缓解高维小样本问题。该方法放宽了潜在数据矩阵与知识矩阵间严格的一对一信号对齐假设,采用两步谱嵌入:先剔除知识矩阵中的无关成分,再以投影方法分别恢复共享与异质成分。仿真和真实多发性硬化症队列分析显示,在共享信号微弱且仅部分对齐的困难场景下,该方法优于对比方法。
研究者提出 Weighted Temporal Quantile Adjustment(W-TQA),将单位历史学到的相似度权重与自适应目标专属误覆盖率结合,用于部分观测面板中的在线共形预测。
一篇被 IEEE TPAMI 接收的综述从自相关建模视角系统梳理了深度时间序列预测,指出该领域两大核心挑战是设计骨干架构建模历史序列自相关、设计损失函数建模标签序列自相关。该综述提出同时覆盖骨干架构与损失函数的分类体系,弥补了此前综述对损失函数覆盖不足的空白,并从统一的自相关视角分析文献动机与洞见。
研究者提出基于核化 Stein 差异(SKSD)的半参数拟合优度检验,并设计了一种无需重新拟合模型或从中采样的影响调整 wild bootstrap,用于构造 level-α 检验。该检验在经典正态性检验到难解似然模型的模拟中,以低数个数量级的计算成本取得相当或更优的检验功效,并已用于评估肺腺癌反向蛋白阵列数据的蛋白信号网络模型。
论文提出"动作驱动过程",将随机过程与强化学习统一起来,并展示其在脉冲神经网络上的应用。借助 control-as-inference 思路,作者证明:对恰当定义的动作驱动过程,最小化策略驱动的真实分布与奖励驱动的模型分布之间的 KL 散度,等价于最大熵强化学习。
针对 Mixup 数据增强中"鲁棒性提升但校准误差(ECE)显著增大"的权衡问题,研究者提出 DRO-Augment,将 Wasserstein 分布鲁棒优化(W-DRO)与多种 Mixup 策略结合,在 CIFAR-10、CIFAR-100、CIFAR-10-C 和 CIFAR-100-C 上大幅降低 ECE,同时基本保持损坏数据准确率。
该论文对含隐藏混杂因子的线性 ODE 系统进行可辨识性分析,填补了潜变量与系统交互时可辨识条件的研究空白。研究分两种情况:潜混杂因子无因果关系但按时间 t 的多项式等函数形式演化;潜变量因果关系由 DAG 描述。作者在单/多轨迹的连续与离散观测条件下给出详细分析,并用仿真验证理论结果。
研究者提出一种面向时空场景的预测驱动推断方法,在仅有短期带标签时间序列、较长无标签时间序列和不完美预测器的条件下,为各空间位置的未来期望标签提供可靠点估计与置信区间。该方法针对 PPI 的 i.i.d. 假设在时间依赖下失效的问题,结合 HAC 程序处理时序相关性,实验显示其优于自然替代方案。该工作已被 NeurIPS 2026 TS-LIMITS Workshop 接收。
研究从含噪高维数据生成的随机几何图中恢复低维潜在几何结构的问题,分析了 Signal+Noise Graph Model 上谱嵌入算法的性能。在点数 n 与环境维度 d 均趋于无穷的高维情形下,证明在谱间隙条件下,图邻接矩阵的顶部特征向量和特征值可将点云近似恢复到正交变换以内。结果在嵌套球面和高维正弦曲线采样的点云上得到验证。
研究者将 L 个 Hopfield 模型通过 Hebbian 模块内耦合与 anti-Hebbian 模块间耦合组成模块化联想网络,其积分表示对应 L 个隐藏层相互耦合的受限玻尔兹曼机(RBM),从而把 HM-RBM 对偶推广到模块化场景。
针对竞争风险标签的拆分共形预测集,完整案例校准在名义 0.900 下仅覆盖 0.8723(22% 受试者在预测期内无事件)。在 48 组额外设计中,有 4 组完整案例覆盖率低于名义值至少四个标准误,而正确设定的删失模型权重可将覆盖率维持在名义水平附近。研究将 Yi et al. (2025) 的论证扩展到原因标签,建立了带删失模型误差显式惩罚的有限样本覆盖下界,删失模型设定错误同样会导致覆盖不足。
研究将推理任务的奖励建模为响应空间上的分层函数,由无穷多个局部组件构成,每个组件仅在前序组件解决后才生效。基于 Transformer 的 actor-critic 算法在采样、拟合 critic 与策略更新间交替,在查询预算和正则化强度上达到 minimax 最优速率,对固定提示词数量也最优。
针对 log-vMEM 模型参数随维度和滞后阶数快速增长的问题,该研究引入分层滞后结构进行正则化估计,并采用分块坐标下降算法配合 Gauss-Seidel 式更新方案。
研究证明对称感知与对称无关特征学习间存在多项式样本复杂度分离。在秩增长的多指标模型中,权重共享架构与全群数据增强均以 Õ(d^{p-1}) 样本实现弱方向恢复,而对称无关学习需 Õ(rd^{p-1});纯二次 Hermite 链接下对应复杂度为 Õ(d) 与 Õ(rd)。全群数据增强与架构权重共享样本效率相当,均优于无对称训练。
研究在 1.375 亿行的 Trendyol 排序特征表上评测五种多列双样本漂移检测方法,发现基于 Apache Spark 的分布式最大均值差异(MMD)配合 Random Fourier Features 表现最稳健,在强漂移区间与预期漂移幅度的 Pearson 相关系数达 r = 0.940,真阳性率 80.4%,假阳性率 3.2%。
研究将数据源间均值偏移的移除建模为统计决策问题,推导出在硬失真预算下学习单一线性映射的精确有限样本极小极大风险为 (d-k)E[1/(d+2J)],其中 J~Pois(κ/2),k 为可删除方向数,κ 为校准信噪比。
Spectra 是一种面向扩散模型仿真推断(SBI)的测试时自适应方法,通过精确的 score-transport 恒等式,在冻结的扩散模型上以闭式解获得适配后的 score,无需额外仿真或训练。在六个 SBI 基准上,Spectra 在先验大幅偏移下实现准确适配,且在线采样成本低,使预训练 SBI 模型能在测试时纳入更新的先验信息。
研究揭示 Prior Fitted Networks(PFN)如 TabPFN 在位置估计任务中实现统计自适应的机制:softmax 注意力在标量输入上计算经验累积生成函数的导数,同时提供区分数据族的特征并形成在样本均值与中程之间插值的估计器。
研究者提出一种通用框架,可为 Poisson 等常见离散随机变量构造有限阶精确路径梯度估计器,该估计器是所有对次数不超过某阶多项式无偏的解中范数最小的解。它保留硬前向采样、无需温度调参,几行代码即可实现,且在所有可行解中唯一并最小化权重方差。实验显示,其低阶方法在线性、非线性和分层潜变量模型上匹配或超越调优基线,并在每项运行时基准中快于竞品。
一项理论研究证明,在多个高斯混合分类任务上对抗预训练的足够深的线性 Transformer,可通过干净示例的上下文学习,在未见任务上渐近达到鲁棒贝叶斯误差,而标准训练的模型做不到。研究还分析了梯度流下的收敛性、精度与鲁棒性的权衡以及示例复杂度。
研究从固定设计的恰好 s 个不同行进行岭回归,响应固定而仅子集随机,证明当 s 超过目标有效维度时,存在唯一惩罚项使所选岭回归拟合在期望上匹配全数据岭回归拟合。针对平衡符号坐标副本,严格扇区不等式给出从维度到行数减一各预算下的锐利风险及全部最大化响应,并构造出同样本无偏的岭—Horvitz—Thompson 混合估计,具有更低锐利风险与精确均值份额改进边界。
针对 entry-wise i.i.d. 对称 α-stable 重尾数据下的线性回归经验风险最小化,研究引入函数型序参量刻画每个系数对应的随机有效问题,并用复本方法完整刻画了样本量与特征维度按固定比例发散的高维极限下的泛化误差。该分析还建立了重尾普适性定律、典型误差与预测可靠性之间的 scaling law,以及 Bayes 最优预测误差。
数据同化(DA)通过将模型预报与观测结合来最优估计系统状态,对大气等混沌系统至关重要,全球业务预报中心通常每 6 小时执行一次。这篇 13 页综述讨论了机器学习(ML)与 DA 交叉这一新兴且快速发展的领域,概述了其中的主要课题与方法。
研究提出用 n-聚合归一化流链做仿真推断中的似然近似,前向复杂仿真模型的多组复制观测数据依次通过多组双射变换,前 k 组变换的参数按最优性顺序估计,不受其余 n-k 组影响。该框架通过经验似然估计与带混合分布的序贯决策两条数学路径更新和聚合归一化流参数,并附带一个以正向仿真参数为条件的代理模型,支持样本生成及贝叶斯范式下的推断、假设检验与不确定性量化。
研究者提出一种基于 Blackwell 序的多变量高斯系统部分信息分解(PID)方法,证明高斯信道在提取冗余信息和并集信息时均为最优,并给出直观的几何解释与高效数值算法。其并集信息与协同信息同 BROJA 度量一致,并推导出双信源下的闭式解;该方法可扩展到上千维或上千信源的系统,并在一个最优控制问题中识别出传感器与记忆之间的冗余和协同交互。
研究者提出 Hierarchical Spectral Shrinkage(HSS),一个可扩展的 empirical-Bayes 框架,用于对任务特定的谱估计量进行部分池化。该方法将各任务的主导谱方向向数据自适应学习到的公共基正则化,并允许收缩程度随任务和谱分量变化。在合成实验和多研究基因表达数据上,HSS 在估计精度和样本外表现上均优于独立估计、完全池化和共享子空间方法。