跳到正文
今天10月7日周三374 条
  1. arXiv stat.ML22

    Spectra:基于扩散模型的仿真推断测试时先验自适应方法

    Spectra 是一种面向扩散模型仿真推断(SBI)的测试时自适应方法,通过精确的 score-transport 恒等式,在冻结的扩散模型上以闭式解获得适配后的 score,无需额外仿真或训练。在六个 SBI 基准上,Spectra 在先验大幅偏移下实现准确适配,且在线采样成本低,使预训练 SBI 模型能在测试时纳入更新的先验信息。

  2. arXiv stat.ML20

    通过有限阶松弛将路径梯度扩展到离散随机变量

    研究者提出一种通用框架,可为 Poisson 等常见离散随机变量构造有限阶精确路径梯度估计器,该估计器是所有对次数不超过某阶多项式无偏的解中范数最小的解。它保留硬前向采样、无需温度调参,几行代码即可实现,且在所有可行解中唯一并最小化权重方差。实验显示,其低阶方法在线性、非线性和分层潜变量模型上匹配或超越调优基线,并在每项运行时基准中快于竞品。

  3. arXiv stat.ML12

    用聚合归一化流链实现复杂仿真模型的似然近似与推断

    研究提出用 n-聚合归一化流链做仿真推断中的似然近似,前向复杂仿真模型的多组复制观测数据依次通过多组双射变换,前 k 组变换的参数按最优性顺序估计,不受其余 n-k 组影响。该框架通过经验似然估计与带混合分布的序贯决策两条数学路径更新和聚合归一化流参数,并附带一个以正向仿真参数为条件的代理模型,支持样本生成及贝叶斯范式下的推断、假设检验与不确定性量化。

  4. arXiv stat.ML26

    自我监控的测试时自适应为何失效:多步时间序列预测中的可交换性假设崩塌

    多步时间序列预测中,当监控与自适应共用同一预测误差反馈时,重叠目标与误差依赖会破坏监控统计保证所依赖的关键假设,导致无有害变化时也触发警报并进一步损害预测质量。研究还发现自适应会把持续性变化从自身监控中隐藏,而原始冻结模型反而保留更清晰的信号。

  5. arXiv stat.ML13

    稀疏支持向量机的高维统计推断

    研究者提出一套针对稀疏支持向量机(SVM)的高维统计推断框架,在样本量与特征数成比例增长时,通过将 L1 惩罚 SVM 表示为线性规划并借助对偶变量识别 hinge 损失次梯度,得到坐标渐近高斯的去偏估计量。该方法可给出单个特征的置信区间与假设检验,并实现错误发现率受控的变量选择,在强相关协方差结构下的模拟及高维乳腺癌基因表达数据分析中验证了校准、功效与变量选择表现。

  6. arXiv stat.ML22

    高维在线校准的调和权重方法:d 个二值结果同时预测实现 d^{O(1/ε)} 轮 ε-校准

    研究者提出一种基于调和权重的在线校准算法,对 d 个二值结果同时预测(Y=[0,1]^d)可在 d^{O(1/ε)} 轮内实现 ε-校准,将维度依赖从指数级降至多项式级。该方法对多分类预测(Y=Δ_d)同样达到 d^{O(1/ε)} 速率,优于此前 d^{Õ(1/ε²)} 的界。算法每轮输出过去结果的调和加权分布,其权重源于离散 Hilbert 变换矩阵在任意 L 范数下达到最优差异度。

  7. arXiv stat.ML17

    多臂老虎机中的 Nash 社会福利:轨迹级期望与高概率遗憾

    研究针对以累积奖励几何平均衡量的 Nash 社会福利(NSW)目标,提出轨迹级 Nash 遗憾,先对完整样本路径取几何平均再求期望,比原有指标更严格。同时给出首个高概率 Nash 遗憾界,其两阶段算法 RR-NCB 结合轮询探索与 Nash 置信界索引策略,达到 Õ(√(k/T)) 的最优速率。该工作已被 NeurIPS 2026 接收。

  8. arXiv stat.ML15

    ORUCB:在线延迟决策中学习修正专家答案

    研究者提出 ORUCB,在在线学习延迟(online learning to defer)场景中,让学习器在购买专家答案前先固定一个修正函数,再对收到的答案应用该函数。该方法通过池化共享与专家专属的多项式响应,在固定问题参数下实现高概率伪遗憾 O(√T log(T+1))。在四个测试流上,所选三次策略的费用包含成本低于七个直接使用原始答案的基线。

  9. arXiv stat.ML12

    Memory Prediction Excess:随机过程中预测增益与记忆长度的概率度量

    研究者提出 Memory Prediction Excess(MPE),用于量化离散时间有限状态过程中,使用全部历史相比仅用静态边缘分布所带来的预测准确率平均提升。MPE 恒为非负,其上限取决于静态准确率,并给出归一化版本与有限历史 MPE(FH-MPE),据此定义达到全历史预测性能所需的最小记忆长度;对有限阶马尔可夫链,该长度被证明不超过马尔可夫阶数。

  10. arXiv cs.AI23

    选择性状态空间模型的分布式学习:架构感知收敛分析

    研究针对 Mamba2 等选择性 SSM 在分布式学习中缺乏架构感知理论的问题,推导了单层与多层选择性 SSM 的梯度与平滑性边界,以及 FedAvg 和 FedProx 的收敛边界,刻画循环稳定性、输入相关离散化和状态投影范数对联邦优化的影响。作者在教师 SSM 生成的序列上数值验证了单层边界,并在六个文本域上对比九种联邦学习算法用于 Mamba2 语言建模。

  11. arXiv cs.AI36

    无需更多训练:SURGE 用 RL 历史检查点融合提升推理能力

    论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。

  12. arXiv cs.AI27

    局部稀疏性实现无监督 LLM 安全检测

    研究者提出基于局部掩码 SAE 的无监督异常检测框架,利用线性表示假设下邻近点共享小共同活跃支撑的特性,在多种架构和数据集上验证了 LLM 安全检测的可行性。当允许使用 1% 的分布外数据校准时,该方法达到接近最优的性能,且仅需 1-2% 的 SAE 神经元参与计算。该工作发表于 NeurIPS2026。

  13. arXiv cs.AI27

    SpliTEE:用 GPU 辅助 TEE 结合差分隐私实现快速私密 LLM 推理

    SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。

  14. arXiv cs.AI27

    PertMind:用细胞扰动数据强化学习激发 LLM 涌现生物推理能力

    PertMind 将细胞扰动图谱转化为强化学习环境,以实测基因响应作为可计算奖励,结合可信轨迹监督初始化与基因、通路、格式三级强化信号。该模型仅在正向扰动响应预测上训练,却在未见细胞环境中提升响应推断,并零样本迁移至反向扰动识别、双扰动推理、表型筛选优先级排序和生物过程解读。

  15. arXiv cs.AI22

    财务披露文本中的细粒度不一致分类诊断研究

    研究基于合成基准 SBID-FD,将已知含冲突的段落分为 11 类不一致类型,并对比冻结编码器、微调编码器、证据增强分类器、提示式大语言模型与 LoRA 适配生成模型。结果显示任务特定适配显著优于冻结表示,微调后的 300M 编码器可与更大规模的提示与适配模型竞争。自动提取的证据能提供额外信号,但仅能恢复参考跨度带来的部分收益。

  16. arXiv cs.AI22

    Prime Fourier Embeddings:面向模运算的原理性基

    研究者提出 Prime Fourier Embeddings(PFE),将整数编码为素数索引的 (cos, sin) 对,使模运算只需选择相关素数通道。基于 Schur 引理,作者证明任何对乘积群作用等变的线性映射必为块对角结构,每个素数对应一个独立块;中国剩余定理可预测无平方因子合数模的任务相关通道。

  17. arXiv cs.AI22

    面向潜在建模的敏感性塑造:提升生成动力学模型的 OOD 检测与安全规划

    研究者提出 support-conditioned control-sensitivity regularization,通过促进训练充分区域的局部响应性来保留控制引发的状态变化,解决学习动力学对控制不敏感、掩盖 OOD 信号的问题。该方法在视觉避障、操作和真实机器人导航实验中提升了 OOD 检测能力与闭环规划安全性,论文已被 CoRL 2026 接收。

  18. arXiv cs.AI24

    Characterize Then Distill:大输出空间中的机制化推理

    研究揭示推理训练语言模型在数千至数十万候选标签中做多标签选择时,依赖一组小型、全局、分阶段的注意力头,在 MIMIC-IV 临床编码任务(5,651 个诊断码全部入上下文)中经消融与 knock-in 验证为必要且充分。作者提出 MISTILL,在决策事件处额外监督学生模型的池化注意力,跨家族学生对比决策的因果恢复近乎翻倍。

  19. arXiv cs.AI22

    强化学习中的终端表示(Terminal Representation)

    研究提出终端表示(TR),一种结构上区别于后继表示(SR)和默认表示(DR)的新型强化学习表示方法。TR 与 DR 一样编码奖励加权轨迹,但可作为更低维对象学习,且无需特征分解即可直接用于选项发现、奖励塑形、迁移学习和探索等任务,同时绕开对称转移动态假设。

  20. arXiv cs.AI22

    面向 LLM 回归的预测分布强化学习:Distribution-Aware Reward 方法

    研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过联合评估同一输入下多次预测形成的经验预测分布,并按留一法贡献为每个预测分配奖励。在合成插值/外推任务及代码、分子两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习降低了预测误差、提升了排序质量,并给出校准更好的不确定性估计。