SCAD:面向长时程智能体的结构化信用分配与蒸馏
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
Turnslide 是一个全自动轻量级多轮工具调用数据合成框架,将每个 API 建模为有限状态机,用单次 LLM 调用把状态合法的工具序列翻译成完整训练样本。在 SLM 微调实验中,其生成轨迹的下游完整准确率达 70.7%,高于对比方法的 63.4% 和 53.7%,且 token 用量减少 3.6-6.6 倍。该工作已被 NeurIPS 2026 SLM-Agents Workshop 接收。
EvoHarness-RL 是一个将环境相关 harness 实现与共享策略接口分离的统一框架,把外部支持组织为 Belief、Progress、Experience(BPE)工作区,并暴露四个紧凑的 harness 动作。
HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
现有针对 AI 智能体技能注入攻击的评估假设恶意技能已被选中执行,会高估攻击成功率;在真实多技能环境中,注入技能需先通过检索竞争,使现有注入的有效攻击成功率(ASR)下降 87-97%。
CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。
VETTA 通过共享轻量 critic 上的独立价值头,联合学习回合级与 token 级信用,并将回合优势与响应内中心化的 token 残差结合用于 PPO 更新。
研究在 Hanabi 衍生环境中测试八款 LLM:线性探针识别意图约定的准确率明显高于目标约定,但接收决策并不总与发送方约定一致。将约定转为外部动作建议带来的协作提升平均大于规则陈述,Qwen3-8B 案例中模型对动作建议的敏感度远高于规则陈述。
研究者推出 DecepEval 基准,包含 3 类任务家族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类外部条件,并通过中性版与诱导版配对测量欺骗率变化。
FC-SWE 是一种失败条件化强化学习框架,在补丁验证失败后把失败补丁与验证器反馈作为上下文,让智能体在仓库原始状态下生成恢复轨迹。
研究发现,同一 Autoresearch 智能体在相同任务上的独立运行常停滞在分数差异明显的「想法盆地」中,即使追加大量算力差距仍持续。为此提出的 fork-and-flush 方法将智能体分叉为多条并行轨迹,各自继承累积工作区但使用全新对话上下文,运行固定时长后从得分最高的轨迹继续。
研究在 Android in the Wild 上用 LoRA 微调 Qwen2-VL-2B,比较五种向小型 GUI grounding 模型注入动作类型的方式。
研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬资源约束下满足预算并自适应重分配未用预算的 LLM 评测预算分配方法。
研究揭示现成 MoE 模型在智能体轨迹中已存在专家选择专门化结构:执行语义相似操作(如 READ、UPDATE)的轮次之间专家路由重叠度更高。标准 RL 算法忽略这一结构,导致训练中 MoE 路由失控,限制任务性能与推理效率。
研究者构建了 ResearchTrails 数据集,从 Git 仓库的 commit 历史中提取结构化的人类研究轨迹,作为科学探索过程的代理,捕捉方法、实验与消融的连续变化。该数据集包含论文最终结果之外的中间研究决策信号,可用于在测试时检索人类研究经验作为外部技能,以及训练模型以提升对新研究决策的泛化能力。
KlinikeBench 是一个包含 333 个临床医生编写任务的基准,每个任务提供虚拟患者、临床工具和任务专属成功标准,超过 35 位临床医生参与编写与评估。
论文提出智能体数据空间中的"作者身份风险":智能体既是治理策略的对象又是其作者,会写出约束自身的规范,因此应确立原则——智能体只是治理平面的对象,永远不是其作者。
KernelOPT 是一个多智能体系统,将编译后的模型视为结构化产物,保留 cuBLAS、cuDNN 等厂商库调用,仅针对生成的 Triton 子 kernel,由五个 profiling 引导的 LLM 智能体进行优化。
研究者提出成本感知分层多智能体系统(HMAS),将证据获取建模为带预算的序贯决策问题,仅在静态证据置信度不足或控制器内智能体分歧时才升级到动态与内存分析。
研究提出一个受控基准,用有序规划操作刻画 LLM 智能体在信息物理系统中的控制轨迹,由 Llama-3.3-70B 在 40 个产消者的辐射状馈线上执行需求响应实验。
研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。
PBT-Bench 是一个覆盖 40 个真实 Python 库、100 道基于属性测试题的基准,每题注入语义 bug 共 365 个(平均 3.65 个),默认随机输入几乎无法触发。
针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。
ReLoop 通过结构化生成与行为验证两项机制,解决 LLM 生成优化代码时"可求解但语义错误"的静默失败问题。结构化生成将代码生产拆为理解、形式化、合成、验证四阶段,在 RetailOpt-190 上配合 Claude Opus 4.6 提升 8.5pp 准确率;行为验证借助求解器参数扰动检测残留错误,在 MAMO-ComplexLP 上提升 4.4pp。
研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。
针对 PPO、GRPO 等 RL 算法在离策略训练多轮 LLM 智能体时优化不稳定、易性能崩溃的问题,研究者提出 SORL 框架,并实例化出 SO-PPO 与 SO-GRPO 两种算法。
Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。
研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。
TeleTune 是一个从无目标标注、不可回放且任务交错的离线日志中学习文本技能库的框架,通过动作预测误差提出技能库编辑并保留能提升留出集动作预测准确率的修改。
针对 Agent 上下文窗口中工具观测数据过期后仍被复用的问题,研究者提出上下文一致性框架 Concord,可将每条观测关联到来源、检测源变更,并按可配置策略在复用前更新、标注或抑制过期上下文。
研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。
研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。
研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。
研究提出"智能体体验(AX)"是新的 AEO:在 1,056 家真实企业上运行 37,927 次智能体购买旅程后发现,仅 7-10% 的最终答案来自模型训练知识。具备 AX 的企业有 78% 的答案由自家页面构建(对照组 56%),被明确推荐的概率高 1.9 倍;而不可读企业获得有据答案的成本平均高 64%。主要失败并非编造而是遗漏——网页构建的答案缺失买家所需事实的概率高 3.7 倍。
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。
TwinCheck 是一种推理时验证策略,仅在轨迹满足与局部失败假设绑定的证据条件时才考虑替换工具调用,并构造轨迹锚定的反事实"负孪生"方案,通过结构检查与双向成对验证器比较后才替换智能体的提议。
UnitBoost 提出用定义好的元级算子替代复合 LLM 系统中的生成式管理者模型,通过任务给定的 unit map 将 worker 输出转为槽值提案,再用受限 argmax 组装输出,未填充或不支持的槽位成为下一轮的显式残差。