ServeLearnBench:智能体能否从服务经验中自我改进?
研究者提出 ServeLearnBench,用于评估 LLM 智能体从服务经验中持续学习的能力,覆盖零售客服、银行和销售话术生成,包含 53 个环境窗口和 7,718 个任务。
研究者提出 ServeLearnBench,用于评估 LLM 智能体从服务经验中持续学习的能力,覆盖零售客服、银行和销售话术生成,包含 53 个环境窗口和 7,718 个任务。
研究揭示工具调用智能体在证据到行动链条上的失败模式:在十种模型-框架配置中,静态动作评估能力强,但交互式执行明显偏弱。失败常始于执行前——智能体调查不完整便停止,或在所需证据建立前就行动;一旦证据齐备,单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。
加州葡萄园精准病害防控项目评估了两种人机协作工作流。Workflow 1 中,多智能体研究系统 Aleks v1 在 145 分钟内开发出 vine-scale 预测模型,在回顾性模拟中对 45% 藤蔓位置进行侦察,模型辅助行优先级排序将新记录红叶观测的遇到比例从 85.8% 提升至 94.1%。
SWORD 是一个联合优化多智能体工作流拓扑与自然语言提示词的框架,仅依靠标量任务指标引导,无需领域初始化或任务特定工程。在相同骨干模型的受控对比下,SWORD 相较仅提示词、仅工作流及分阶段优化基线均取得统计显著提升,并在使用更小骨干模型、更少训练数据和每数据集 4–6 美元 API 成本的情况下,准确率超过最强的已发表领域专用基线。
研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。
研究者提出 Stateless Language Agents(SLAs),核心是"有状态搜索、无状态智能体":智能体不跨调用保留对话,由 harness 持有研究状态并为每次调用重建角色专属上下文。
研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器开发。
研究提出用基础模型(FM)提升多智能体强化学习(MARL)在无线随机接入(RA)网络优化中的效率,设计了基于共识的去中心化 MARL 架构下的 FM 辅助 actor-critic 算法。收敛性分析表明,该算法在局部奖励交换与非线性价值函数近似下,达到与传统 MARL 相同的收敛阶数。数值结果显示该方法显著提升了 RA 网络优化的 MARL 速度。
研究用多个不同基础模型构建异构社交网络模拟,发现智能体获得的互动量更多取决于其基础模型而非被分配的人格。当混合的模型数量增加时,基础模型的吸引或排斥效应显著增强,暗示网络动态在大规模下可能收敛于基础模型效应。内容中介分析显示基础模型跨语境具有可预测性,且模型的词汇模式与互动最大化风格存在关联。
Jarvis 是一款能实时参与多人对话的主动式语音智能体,基于事先共享的文档跟进讨论,仅在群体遗漏或说错事实且数轮内未自我纠正时出声干预。它由小型开源权重模型驱动,结合确定性检查,并将每条论断锚定到原文句子。在 CHI-180-proactive 数据集上,Jarvis 对多数干预事件判断正确,且在群体自行解决问题时 97% 的情况下保持沉默;23 人实时研究验证了这一趋势。
多智能体共享成本预算时,统一 Lagrange 乘子只能约束总量、无法决定惩罚如何在各智能体间分摊,为此研究者提出 Lagrangian Responsibility Allocation(LiRA),通过有限训练周期内优化社会福利来学习每个智能体对公共乘子的分摊比例。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。
CG-CTI 将 CAPEv2 沙箱的实时输出转换为 STIX 2.1,并在知识图谱中与其他关键基础设施传感器数据关联,为每个情报对象附加基于来源、跨源印证和观测持续性的显式置信状态。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
研究者提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整派生(血缘)图,并只在请求者对所有涉及列均有权限时才返回命中,从而阻止经由合法计算结果泄露敏感列。
一篇立场论文提出 SPEAR 框架,将人机智能体对齐重新定义为持续的交互设计问题,而非部署前的优化问题。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
研究者提出统一的 trace 级滥用监控形式化方法,并构建约 6,200 条用户、LLM agent 与环境对话记录的基准,覆盖分解攻击与提示注入攻击两类威胁,标注 harm window 并配良性对照与拒绝实例。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。
研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。
研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。
研究者推出 WorldSolver 基准,包含 168 个源自 61 篇经典计算机图形学论文的仿真任务,覆盖 7 个物理领域,要求 LLM 智能体补全求解器代码。评测从执行检查、视觉保真度和物理合理性三个维度展开,GPT-5.6-Sol 与 Claude-Opus-5 表现相对最好,总分仅为 48.7% 和 46.7%。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。
研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
Recursive Game Creator 是一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件构成递归开发闭环,将游戏原型迭代为可玩性更高的成品。
MINDSET 是一种将对话存为不可变 episode、并通过最小能量状态转移组织成版本化 schema 的记忆控制器,每个新 episode 可强化、取代、拆分或新建 schema。
研究者提出 EMHO,一种在具身模型冻结的前提下,通过分析执行轨迹与历史 Harness 记录来自我迭代优化 Harness 的框架,并配套 EMHO-Merge 以用单套 Harness 支持多子任务。在 EmbodiedBench 的导航与操作任务上,EMHO 持续提升 Qwen 9B 和 27B 的任务成功率。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
研究团队完成了庞加莱猜想的 AI 辅助 Lean 4 形式化,项目起步时几何分析方向可复用的形式化基础设施十分有限。他们用数学家编写的证明蓝图配合明确的里程碑陈述来组织工作,使多个智能体可并行推进,并让数学家能定位阻塞点、给出有效数学指导。该工作分析了这一流程背后的人工介入与组织选择,为未来形式化项目提供了可复用基础设施的起点。
MedZERO 是一个面向开放式医学推理的自进化框架,由负责生成前沿医学题目选项的 Examiner 和借助外部知识工具进行多轮循证推理的 Reasoner 组成,并采用受控知识积累机制维护临时探索知识与精选持久知识。
研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。
LeanPlan 是首个用 LLM 生成启发式函数并对其可采纳性进行机器校验、从而找到最优规划的系统。它通过智能体循环借助规划器反馈迭代改进领域专用启发式函数及其可采纳性证明,并在 Lean 4 中实现启发式、证明与高效规划器。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。
研究者提出 Predicting Intention of Partner(PIP),用 Joint-view VAE 将双方局部观测的并集蒸馏为仅凭自身观测即可获得的伙伴表征,并用伙伴状态信念网络从交互历史推断伙伴的隐藏位置与行为倾向。