SCAD:面向长时程智能体的结构化信用分配与蒸馏
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
研究提出 DAU(Draft、Ask、Update)流程,检验 LLM 能否自动完成临床文档专员向医生发起的澄清提问闭环。团队审计 3000 次真实就诊、分析 2.1 万轮真实对话澄清轮次,并基于公开数据构建五个转录降级基准;发现有用提问的预测因子因任务而异,约 9% 的轮次反而损害性能,多由冗余提问和仍触发改写的非回答造成。
研究者提出 SkillEvoLean,一种变异增强的技能自进化框架,用于构建技能增强的 Lean 证明器,在不更新模型参数的前提下联合进化高层求解策略与参考知识。
研究提出"洞见溯源"(Insight Provenance)任务,判断审稿洞见来自人类、LLM 还是二者混合,并基于 4,057 篇论文和 12,660 条人类审稿构建 InsightProv-v0,用 GPT-4o、Gemini 和 DeepSeek 模拟不同 LLM 参与程度并做句级标注。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
研究团队推出 Kurate,利用 LLM 评估已发表研究的质量,并结合论文及其试验注册、研究方案等相关文档,将每项判断链接到对应原文段落。该系统对 4,347 篇论文(其中 3,913 篇为随机试验)按统计功效、因果识别、预注册等 8 个维度打分,发现统计功效、选择性报告和分析预注册问题最为常见。
针对损失与约束函数随回合对抗变化、转移未知的片段式对抗线性 CMDP,新提出的 primal-dual 算法将 regret 与累积约束违反从 \widetilde{\mathcal{O}}(K^{3/4}) 降至 \widetilde{\mathcal{O}}(\sqrt{K}),且无需 Slater 条件。
研究者提出一种仅以奖励和动作为条件的奖励策略,可在观测空间完全不同的源环境与目标环境之间实现零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练后,可零样本迁移到不同配色、3D 渲染以及 Habitat-Sim 中的 Stretch 机器人导航任务。基于奖励的策略还能进一步引导目标环境中基于观测的策略训练。
研究者用低秩适配器训练模型按隐含线性偏好函数为虚构角色做决策,发现持续微调能让模型在无显式自我报告监督下准确报告自身学到的偏好。权重消融与冻结层实验显示偏好表征随训练前移至更早层,而 attribution patching 发现忠实模型的决策与自我报告任务间归因相似度显著更高,可作为区分忠实与不忠实自我报告的机制特征。
研究者提出 SPARC(Shared Phase and Retention Control for Efficient Adaptive Spectral Recurrence),仅用两个输入相关的标量信号即可在高维复数谱记忆中统一控制记忆保留与相位旋转,无需为每个记忆模式单独分配控制。
JudgeMoE 是一种轻量聚合器,对缓存的 judge 分数分布分配样本级权重并在计算最终分数前融合。在原始 10-cell 基准上,其平均 Spearman 相比 uniform log pooling 提升 +0.079;在 16 个 cell 上相比最强单一 judge 平均提升 +0.0393,12/16 个 cell 为正,单侧 Wilcoxon 符号秩检验 p=0.0091。
针对 LLM 遗忘中固定参数子集的做法,研究者提出 Intervention Score 与选择性动态干预重排(DIR-R),按实际遗忘更新的预测效果对可编辑参数组排序,并在校准探针支持下动态重排。
Turnslide 是一个全自动轻量级多轮工具调用数据合成框架,将每个 API 建模为有限状态机,用单次 LLM 调用把状态合法的工具序列翻译成完整训练样本。在 SLM 微调实验中,其生成轨迹的下游完整准确率达 70.7%,高于对比方法的 63.4% 和 53.7%,且 token 用量减少 3.6-6.6 倍。该工作已被 NeurIPS 2026 SLM-Agents Workshop 接收。
LionMuon 提出每 P 次迭代执行一次 Muon 谱步、其间执行 Lion 符号步,两者共享单一双 EMA 动量缓冲区,使 Muon 的计算与通信开销每 P 步仅支付一次,优化器状态仅为 AdamW 的一半。
WavePrune 通过将 RoPE 每个通道限制在第一个旋转周期内,消除位置混叠带来的注意力干扰,在五个测试模型中的四个上无需额外调优即提升 HELMET 分数(如 Qwen3-8B 从 35.7 升至 40.0)。
ZonoGPT 是一种用于验证大型 Transformer 的抽象域,其空间复杂度与网络深度无关。它采用结构化 zonotope 与生成元约简机制,并为 Attention、LayerNorm 引入分块融合变换、为 GELU 引入仿射变换以保持精度。
KVCMAS 是一个在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体缓存偏差,并沿智能体工作流无缝串联修正,无需额外参考预填充,同时保留精确的首个智能体缓存。
EMODE 是一个情感感知语音语言模型,核心是动态副语义专家(DPSE),将连续语音特征拆分为语义与副语言两条路径并动态路由、融合后再接入语言模型。它采用语义预热、副语言激活、联合精调三阶段课程训练,配合 OEG、SAA 与 GDR 引导。在 SER 测试、共情回复评测及新建双语 MEPA 基准上,EMODE 改善了词汇保真与情感敏感度的平衡。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
研究提出条件锚定生成蒸馏(CAGD),保留少量旧提示词,用冻结的旧模型重建补全与生成状态,并在学习新任务时匹配其预测分布。在 219M 掩码扩散语言模型的持续适配中,CAGD 将四任务最终留出损失从 2.927 降至 1.114,反向任务顺序下从 2.168 降至 0.891。在教师生成支持相同的情况下,软目标比硬回放的平均损失低 0.055。
SketchSSM 提出"全状态更新、近似读取"方案:每次状态更新时读取一次完整状态,为离线固定的基向量预计算输出并存入紧凑草图,后续解码步骤用查询相关系数组合草图向量重建输出,无需再读全状态。
NavTree 是一种仅用叶节点的检索器,在 chunk 上构建确定性平衡线段树,索引阶段零 LLM 调用,仅将树作为导航骨架,通过词法与稠密混合的前沿游走从根节点下行并只向阅读器输出叶 chunk。在匹配成本评估中,它是所评测网格里最强的分层检索器,并与最强扁平基线持平;在长文档多跳 QA 上,它是唯一在类对类比较中显著优于 BM25 的分层方法。
研究者提出 Adaptive LeWorldModel(ALeWM),一种基于 JEPA 的世界模型,通过让预测器从采样的前缀长度估计完整下一嵌入,把预测信息集中到宽潜在表示的紧凑前缀中。
研究将语言模型激活空间中潜在结构的因果影响力拆解为容量、响应性与对齐三个因素,在4个LM家族和50个概念上验证三者需同时较高才有效。容量或响应性偏低分别使因果效果下降84%和95%,对齐偏低甚至会逆转效果、抑制概念表达。基于此提出的因果探针将跨模型引导效果提升17%-118%,概念检测仅下降3%。
研究者提出一种分层因果表征学习框架,应用于先进全球气候模型的海表温度场,首次同时显式建模内部气候变率引发的大气动力相互作用与温室气体、气溶胶浓度变化带来的强迫响应。在未见过的未来气候情景上评估时,该方法能准确预测长期全球平均及区域温度演变,并对温室气体和气溶胶浓度扰动给出物理上合理的响应。
FedGuide 是一个面向异构环境的联邦强化学习框架,用扩散先验作为行为模型为各客户端提供个性化数据分布,并通过最优传输混合专家(OT-MoE)聚合这些先验,而非直接平均本地策略。
研究通过短时固定权重衰减(WD)扰动扫描 Grokking 泛化前的平台期,发现扰动对泛化时间的影响在平台期早期无序,随后在可见泛化前形成稳定的剂量排序:WD 增强导致更早泛化,WD 减弱导致更晚泛化。
研究系统评估了 TabPFN-TS 和 Chronos-2 在德国两个区域供热网络中的零样本概率热负荷预测表现,并与训练基线对比。全年基准中两个时序基础模型在确定性精度上均优于所有训练基线,Chronos-2 在主数据集上取得最佳 CVRMSE 12.48%,TabPFN-TS 为 13.07%。采用 12 周滚动上下文与环境温度的每小时 24 小时预测即可,更长上下文窗口未提升精度。
研究提出三种基于距离的图自编码器(GAE)变体,在重建损失中引入结构惩罚,均采用两层 Graph Convolutional Network 编码器和欧氏距离解码器。
针对 JEPA 世界模型联合训练中表征坍缩导致潜在距离无法反映任务目标的问题,研究者提出 SCALE(State-CAlibrated Latent Embeddings),将采样的成对潜在距离与任务相关状态空间距离相关联。
EvoHarness-RL 是一个将环境相关 harness 实现与共享策略接口分离的统一框架,把外部支持组织为 Belief、Progress、Experience(BPE)工作区,并暴露四个紧凑的 harness 动作。
研究提出一种无标签的结构前沿划分方法,保留最稀疏且理化性质最偏远的骨架组,在六个公开 ADMET 任务上评估。相比 70/10/20 骨架对照,前沿划分使等权主误差中位数上升 87.0%,均值上升 130.3%;移除 BBB 后均值降至 75.9%,该端点是唯一在前沿处排名反转的任务。
研究者提出 Learning from Hindsight(LfH),用预训练视觉语言模型为失败的 rollout 重新标注其实际完成的行为,并将这些辅助任务与目标指令任务联合训练 VLA 策略。
研究探讨用强化学习训练大语言模型同时提升推理准确率并输出置信度时,奖励函数设计不当会诱发"置信度奖励黑客"现象,即模型为让置信度显得校准而故意答错。作者提出"不可黑客攻击的置信度奖励方案"概念及构造方法,并证明可攻击方案在实际数据集上会出现选择性奖励黑客,而不可攻击方案能抵抗该问题。实验还表明不同方案在过度自信—信心不足谱系上呈现相应的校准偏差。
研究针对稀疏自编码器(SAE)的无监督概念发现,提出了一套面向泛化/特化层级的关键要求与具体评估协议。在视觉数据上训练的现有 SAE 方法显示,特征空间虽普遍具备合理层级的基础,但建立良好层级结构仍具挑战。特征吸收(包括硬形式和连续的软形式)会系统性损害层级质量,揭示出未来方法需应对的根本性张力。
针对算法解释常需专业知识才能正确理解、且主流解释算法对复杂决策函数信息量不足的问题,研究者提出 Explanation Cards for Explanation Algorithms,在标准解释上补充鲁棒性与有效性信息及明确的解读说明。以反事实解释和 SHAP 为例,该卡片将解读责任从用户转移给提供方,并被认为可用于落实 EU AI Act 的可解释性条款。
该研究首次给出均值算法定义序列 γ_t 的下界,揭示了此类算法学习速度的根本限制。作者提出两种均值算法,一种泛化 ε-greedy,另一种将均值 Exp3 扩展到未知时域。实验显示均值算法虽略慢,但在 bandit 反馈下可与其他算法竞争,且部分算法同时具备均值与 no-regret 性质。
研究者提出 SeedER(Seed-Expand-Retrieve),一种基于 Graph Transformer 和强化学习的一阶段知识图谱检索器,推理时可在 CPU 上运行,训练时每次只需少量节点的反馈。该方法在检索效果上可与微调 LLM 的方案竞争,同时显著降低内存与计算开销。
该论文提出一个统一框架,将近期基于代理的机器遗忘方法推广,并证明遗忘后模型行为与保留数据理想后验分布之间的 KL 散度上界。方法将近似遗忘建模为约束优化问题,通过后验数据分布的代理引入缩放遗忘信号,必要时以目标模型为教师蒸馏权重更新。在两个遗忘场景实验中,该方法得到的分类器最接近从头重训的模型。
针对离线目标条件强化学习(GCRL)在稀疏奖励下编码器易学到与目标无关特征、导致策略学习不稳定的问题,研究者提出 MSPR 框架,通过多尺度预测监督在隐空间中强化目标导向对齐。该方法在视觉与状态任务上均取得强劲表现,并在具有挑战性的真实数据条件下保持 SOTA 性能。