RELACE:面向长程语言智能体的基于回顾似然的动作信用估计
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。
CG-CTI 将 CAPEv2 沙箱的实时输出转换为 STIX 2.1,并在知识图谱中与其他关键基础设施传感器数据关联,为每个情报对象附加基于来源、跨源印证和观测持续性的显式置信状态。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
研究者提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整派生(血缘)图,并只在请求者对所有涉及列均有权限时才返回命中,从而阻止经由合法计算结果泄露敏感列。
一篇立场论文提出 SPEAR 框架,将人机智能体对齐重新定义为持续的交互设计问题,而非部署前的优化问题。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
研究者提出统一的 trace 级滥用监控形式化方法,并构建约 6,200 条用户、LLM agent 与环境对话记录的基准,覆盖分解攻击与提示注入攻击两类威胁,标注 harm window 并配良性对照与拒绝实例。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。
研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。
研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。
研究者推出 WorldSolver 基准,包含 168 个源自 61 篇经典计算机图形学论文的仿真任务,覆盖 7 个物理领域,要求 LLM 智能体补全求解器代码。评测从执行检查、视觉保真度和物理合理性三个维度展开,GPT-5.6-Sol 与 Claude-Opus-5 表现相对最好,总分仅为 48.7% 和 46.7%。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。
研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
Recursive Game Creator 是一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件构成递归开发闭环,将游戏原型迭代为可玩性更高的成品。
MINDSET 是一种将对话存为不可变 episode、并通过最小能量状态转移组织成版本化 schema 的记忆控制器,每个新 episode 可强化、取代、拆分或新建 schema。
研究者提出 EMHO,一种在具身模型冻结的前提下,通过分析执行轨迹与历史 Harness 记录来自我迭代优化 Harness 的框架,并配套 EMHO-Merge 以用单套 Harness 支持多子任务。在 EmbodiedBench 的导航与操作任务上,EMHO 持续提升 Qwen 9B 和 27B 的任务成功率。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
研究团队完成了庞加莱猜想的 AI 辅助 Lean 4 形式化,项目起步时几何分析方向可复用的形式化基础设施十分有限。他们用数学家编写的证明蓝图配合明确的里程碑陈述来组织工作,使多个智能体可并行推进,并让数学家能定位阻塞点、给出有效数学指导。该工作分析了这一流程背后的人工介入与组织选择,为未来形式化项目提供了可复用基础设施的起点。
MedZERO 是一个面向开放式医学推理的自进化框架,由负责生成前沿医学题目选项的 Examiner 和借助外部知识工具进行多轮循证推理的 Reasoner 组成,并采用受控知识积累机制维护临时探索知识与精选持久知识。
研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。
LeanPlan 是首个用 LLM 生成启发式函数并对其可采纳性进行机器校验、从而找到最优规划的系统。它通过智能体循环借助规划器反馈迭代改进领域专用启发式函数及其可采纳性证明,并在 Lean 4 中实现启发式、证明与高效规划器。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。
研究者提出 Predicting Intention of Partner(PIP),用 Joint-view VAE 将双方局部观测的并集蒸馏为仅凭自身观测即可获得的伙伴表征,并用伙伴状态信念网络从交互历史推断伙伴的隐藏位置与行为倾向。
研究者提出 Test-Time Agent Evolution 方法,通过 Test-Time Memory Evolution 从既往案例检索可复用经验并适配当前事实与程序语境,再经 Rubric-Aligned Collaboration 按行为与程序要求校验修正各角色行动,实现跨角色协同决策。
ChartBmkAgent 能从稀疏的错误分类规范出发,通过中央 harness 治理多个专用智能体,构建完整的 Chart QA 诊断样本,并要求每个阶段提供与原始错误类别对齐的证据。
研究者推出 DSV-Mem 基准,用于评估 MLLM 智能体的密集有状态视觉记忆,包含专家审核场景和 1000 道题,覆盖 Current State、Past State、Derived State、Change History、Conflict/Refusal 五类。
研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。
POLAR 是一个面向小型工具调用智能体的护栏框架,通过结构化双层本体评估动作可逆性,为每个动作生成分级可逆性分数,未达阈值的调用会在执行前被剪枝。在 τ²-bench 上对六种智能体模型评测,POLAR 使其中四个模型在 airline 域的平均任务奖励提升 0.11 至 0.18 分,但十八个模型—领域组合中仅八个整体改善,retail 域及更强模型常出现回退。
研究提出 Self-Retrospection Distillation(SRD),将智能体完成轨迹后的事后经验蒸馏为同一策略在交互前的预见预测,该预见仅作训练目标、推理时无需显式生成。
研究者推出 SPEEDRUNBENCH,一个覆盖 9 款游戏、评估前沿 LLM 智能体策略形成能力的基准,要求智能体反复改进策略、反思表现并长程推理,以不断超越自己和他人。实验显示,前沿智能体在简单平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类。该基准因几乎总存在更快的通关时间而具备抗饱和特性。
DAEDALUS 提出一种无需既有任务或 oracle 验证器、从自生成练习中引导可复用智能体记忆的方法,由生成任务的 explorer 与尝试任务的 solver 配对,将 solver 反复验证成功的启发式规则沉淀为记忆库。
一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。
研究者为完整十英雄 MOBA(206 个单位、每 tick 全英雄行动、单局最长 6,000 tick)学习结构化多智能体世界模型,仅用 1,400-tick 自由推演想象回合训练策略,再在真实对局中评测。
HMED(Hindsight Meta-Experience Distillation)通过从同一恢复的发现状态重新执行原版与修订版 Meta-Skills,在共享条件下观察修订带来的变化,并将每次对比蒸馏为可复用的 Meta-Experience。