WeaveAgent:面向超高分辨率遥感影像的两阶段工具路由智能体
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
研究提出"视觉编排税"概念,用于衡量智能体 VLM 流水线中语义未变的图像在 API 边界被反复重建的冗余。在 SeeingEye 和 MAMMQA 上审计发现 66.8-75.6% 的视觉证据触碰冗余,且每条查询均超过预设阈值。
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
CueRator 是一个通过智能体搜索决策规则来适配冻结对比式多模态编码器的框架,在 OV-AVEBench 上将总平均分从 57.8 提升至 60.2,未见类别性能从 55.8 提升至 59.9,并将已见-未见差距从 7.1 缩小至 1.2。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。
针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。
Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。
研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究提出 TACIT 框架,将外部能力需求分解为 Source、Transformation、World Effect 三个维度,定义八种能力类别,并用 1,600 条平衡训练查询在四个开源 LLM 家族的生成前隐藏状态上训练线性探针。
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
Turnslide 是一个全自动轻量级多轮工具调用数据合成框架,将每个 API 建模为有限状态机,用单次 LLM 调用把状态合法的工具序列翻译成完整训练样本。在 SLM 微调实验中,其生成轨迹的下游完整准确率达 70.7%,高于对比方法的 63.4% 和 53.7%,且 token 用量减少 3.6-6.6 倍。该工作已被 NeurIPS 2026 SLM-Agents Workshop 接收。
EvoHarness-RL 是一个将环境相关 harness 实现与共享策略接口分离的统一框架,把外部支持组织为 Belief、Progress、Experience(BPE)工作区,并暴露四个紧凑的 harness 动作。
HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
现有针对 AI 智能体技能注入攻击的评估假设恶意技能已被选中执行,会高估攻击成功率;在真实多技能环境中,注入技能需先通过检索竞争,使现有注入的有效攻击成功率(ASR)下降 87-97%。
CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。
VETTA 通过共享轻量 critic 上的独立价值头,联合学习回合级与 token 级信用,并将回合优势与响应内中心化的 token 残差结合用于 PPO 更新。
研究在 Hanabi 衍生环境中测试八款 LLM:线性探针识别意图约定的准确率明显高于目标约定,但接收决策并不总与发送方约定一致。将约定转为外部动作建议带来的协作提升平均大于规则陈述,Qwen3-8B 案例中模型对动作建议的敏感度远高于规则陈述。
研究者推出 DecepEval 基准,包含 3 类任务家族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类外部条件,并通过中性版与诱导版配对测量欺骗率变化。
FC-SWE 是一种失败条件化强化学习框架,在补丁验证失败后把失败补丁与验证器反馈作为上下文,让智能体在仓库原始状态下生成恢复轨迹。
研究发现,同一 Autoresearch 智能体在相同任务上的独立运行常停滞在分数差异明显的「想法盆地」中,即使追加大量算力差距仍持续。为此提出的 fork-and-flush 方法将智能体分叉为多条并行轨迹,各自继承累积工作区但使用全新对话上下文,运行固定时长后从得分最高的轨迹继续。
研究在 Android in the Wild 上用 LoRA 微调 Qwen2-VL-2B,比较五种向小型 GUI grounding 模型注入动作类型的方式。
研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬资源约束下满足预算并自适应重分配未用预算的 LLM 评测预算分配方法。
研究揭示现成 MoE 模型在智能体轨迹中已存在专家选择专门化结构:执行语义相似操作(如 READ、UPDATE)的轮次之间专家路由重叠度更高。标准 RL 算法忽略这一结构,导致训练中 MoE 路由失控,限制任务性能与推理效率。
研究者构建了 ResearchTrails 数据集,从 Git 仓库的 commit 历史中提取结构化的人类研究轨迹,作为科学探索过程的代理,捕捉方法、实验与消融的连续变化。该数据集包含论文最终结果之外的中间研究决策信号,可用于在测试时检索人类研究经验作为外部技能,以及训练模型以提升对新研究决策的泛化能力。
KlinikeBench 是一个包含 333 个临床医生编写任务的基准,每个任务提供虚拟患者、临床工具和任务专属成功标准,超过 35 位临床医生参与编写与评估。
论文提出智能体数据空间中的"作者身份风险":智能体既是治理策略的对象又是其作者,会写出约束自身的规范,因此应确立原则——智能体只是治理平面的对象,永远不是其作者。
KernelOPT 是一个多智能体系统,将编译后的模型视为结构化产物,保留 cuBLAS、cuDNN 等厂商库调用,仅针对生成的 Triton 子 kernel,由五个 profiling 引导的 LLM 智能体进行优化。
研究者提出成本感知分层多智能体系统(HMAS),将证据获取建模为带预算的序贯决策问题,仅在静态证据置信度不足或控制器内智能体分歧时才升级到动态与内存分析。
研究提出一个受控基准,用有序规划操作刻画 LLM 智能体在信息物理系统中的控制轨迹,由 Llama-3.3-70B 在 40 个产消者的辐射状馈线上执行需求响应实验。
研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。
PBT-Bench 是一个覆盖 40 个真实 Python 库、100 道基于属性测试题的基准,每题注入语义 bug 共 365 个(平均 3.65 个),默认随机输入几乎无法触发。
针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。
ReLoop 通过结构化生成与行为验证两项机制,解决 LLM 生成优化代码时"可求解但语义错误"的静默失败问题。结构化生成将代码生产拆为理解、形式化、合成、验证四阶段,在 RetailOpt-190 上配合 Claude Opus 4.6 提升 8.5pp 准确率;行为验证借助求解器参数扰动检测残留错误,在 MAMO-ComplexLP 上提升 4.4pp。
研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。
针对 PPO、GRPO 等 RL 算法在离策略训练多轮 LLM 智能体时优化不稳定、易性能崩溃的问题,研究者提出 SORL 框架,并实例化出 SO-PPO 与 SO-GRPO 两种算法。