跳到正文
今天10月7日周三182 条
  1. arXiv cs.AI27

    多智能体系统中的执行一致性:超越修正记忆

    研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。

  2. arXiv cs.AI27

    POLAR:面向工具调用 LLM 智能体的本体引导风险预防框架

    POLAR 是一个面向小型工具调用智能体的护栏框架,通过结构化双层本体评估动作可逆性,为每个动作生成分级可逆性分数,未达阈值的调用会在执行前被剪枝。在 τ²-bench 上对六种智能体模型评测,POLAR 使其中四个模型在 airline 域的平均任务奖励提升 0.11 至 0.18 分,但十八个模型—领域组合中仅八个整体改善,retail 域及更强模型常出现回退。

  3. arXiv cs.AI31

    SpeedrunBench:用视频游戏速通挑战 LLM 智能体

    研究者推出 SPEEDRUNBENCH,一个覆盖 9 款游戏、评估前沿 LLM 智能体策略形成能力的基准,要求智能体反复改进策略、反思表现并长程推理,以不断超越自己和他人。实验显示,前沿智能体在简单平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类。该基准因几乎总存在更快的通关时间而具备抗饱和特性。

  4. arXiv cs.AI29

    同一反馈不同答案:前沿模型客户反馈分析中的运行间不稳定性

    一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。

  5. arXiv cs.AI24

    移动 GUI 智能体能否服务所有用户?PAIR 与 RePAIR 揭示跨用户可靠性差异

    研究提出 PAIR 流水线构建用户条件化应用状态,并推出 RePAIR 训练方法,从跨用户子目标结果差异中学习以提升可靠性。在六款智能体上,用户条件化 UI 中任务成功率下降 6.98 至 15.4 个百分点,涉及用户个人内容时差距扩大至 8.77 至 22.0 个百分点。RePAIR 在未见用户上将整体 Task SR 提升 9.42 个百分点。

  6. arXiv cs.AI26

    Confidence Reasoning Graphs:面向 LLM 智能体的结构化置信度估计

    研究者提出 Confidence Reasoning Graphs(CRG),一种推理时框架,仅凭单条轨迹即可估计 LLM 智能体完成任务的成功概率,无需模型内部信号或训练数据。CRG 将任务声明分解为基于轨迹证据的子声明,逐项估计置信度后再聚合为整体置信度。在三个智能体基准、三个骨干模型和三个智能体框架上,CRG 的置信度校准与风险感知决策均优于口头表达、采样和白盒代理基线。

  7. arXiv cs.AI22

    ShanLiangRen:面向个性化每日膳食规划的 AI 营养智能体

    研究团队提出个性化全量化多目标膳食规划问题(MDP),并开发营养智能体 ShanLiangRen。该系统将饮食规格、营养数据、用户属性与自然语言需求转化为个性化约束规划实例,通过精确检索增强生成缩小候选食材与食谱范围,再由 LLM 在确定性营养计算和约束校验反馈下按 Pareto 原则迭代优化方案。系统输出含明确食材与分量的全量化餐食计划及营养合规报告,已以微信小程序形式上线。

  8. arXiv cs.AI26

    自参照社会偏好:不观察他人奖励也能学会合作

    研究者提出"自参照社会偏好"方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测轨迹,从自身视角评估对方结果,再接入标准社会偏好机制。在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中,智能体无需观察他人奖励即可学会合作,甚至在独立学习失败的环境中也能实现合作,且收益分配常比能获取真实奖励的智能体更公平。

  9. arXiv cs.AI32

    WorkflowOps:为多智能体工作流编排学习智能体协作先验

    WorkflowOps 是一个多智能体工作流编排框架,能从历史工作流中学习智能体协作先验,并按需扩展智能体池以覆盖新能力需求。它通过转移概率矩阵引导 DAG 工作流构建,并用分层语义匹配策略将 LLM 路由调用减少超 80%。在代码、数学与问答混合测试集上,其端到端通过率优于近期工作流构建基线,在结构化可分解任务上提升最大。

  10. arXiv cs.AI27

    DHCG:为基于 LLM 的多智能体推理动态构建分层协作图

    DHCG 框架通过 Planner、Worker、Generator 三个模块,从零逐步构建动态分层协作图,并支持提前终止或按需扩展。在代码生成、数学推理等基准上,其平均性能较单智能体基线提升 13.06 分,优于静态与动态 MAS 基线 2.77-8.02 分。该框架还引入动作感知偏好优化训练 Planner,并展现出跨 Planner 主干与未见 Worker 模型的泛化能力。

  11. arXiv cs.AI29

    OOPMAS:面向查询级工作流生成的面向对象多智能体系统

    OOPMAS 是一个免训练框架,能在单个查询粒度上同时生成智能体集合与协调工作流,智能体以面向对象类定义表示,工作流则表达为可执行 main 函数。在覆盖代码、数学与问答的混合任务基准上,OOPMAS 达到 89.6% 准确率,超出最强基线 18.1 个百分点;跨四个 LLM 基座的模型替换研究显示性能一致扩展,最强模型下达到 92.4%。

  12. arXiv cs.AI29

    ST-Bench:面向科研任务多智能体系统生成的空间-时间基准

    研究者推出 ST-Bench,用于检验 LLM 多智能体系统(MAS)在真实科学数据分析中是否优于单智能体。该基准含 100 个源自地球科学研究的数据科学任务,扩展为 2,067 条查询,在 GPT-5 上评测五种 MAS 生成方法。十种 MAS 配置中九种超过最便宜的单智能体基线,最强配置综合得分接近其三倍,但推理时间约为四倍;更经济的方案以不到两倍成本获得大部分收益。

  13. arXiv cs.AI37

    AgentMemGate:解决对话助手记忆中的推测污染问题

    AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。

  14. arXiv cs.AI24

    EIO-Agents:为 AI 智能体评估补上缺失的语义层

    EIO-Agents 是一个面向可互操作 AI 智能体评估的开放规范,由语义层 EIO 与记录系统 PER 两层构成。EIO 通过类型化证据、版本化行为谓词、证据契约、声明、见证规则、证明状态与可计算推导,支撑指标、发现、控制及 PASS、REVIEW、BLOCK 决策;PER 则以内容寻址方式保存单次评估的证据到决策链,可重新推导、解释与验证。

  15. arXiv cs.AI26

    规则止于何处,裁判始于何处:测量多智能体系统安全中的判断边界

    研究将 LLM 多智能体系统(MAS)的防御组织为五项原则并实现为 DEFER1,包含 28 项检查的级联,能拦截的拦截、其余交给四人评审团。在四个领域的独立测试中,攻击成功率从约 30.0% 降至约 3.0%,78% 被拦截的攻击由确定性检查处理。安全运营领域仅四分之一提案会到达评审团,但风险评分审批门会错误放行多数攻击提案、却只放行少数合法提案。

  16. arXiv cs.AI22

    个人智能体中介推荐:跨平台用户历史如何平衡平台排序的救援与误改

    研究提出"个人智能体中介推荐"范式:平台推荐器用本地信息排序候选集,个人 LLM 智能体借助用户授权的跨平台历史对排序进行中介,生成最终 top-K 列表。为此推出 MediateRec 基准,并给出 Personal Attribution Mediation Optimization(PAMO)训练方法,通过反事实遮蔽跨平台历史来估计个人中介支持度。

  17. arXiv cs.AI19

    交错参与下的多智能体强化学习:SPL 训练增强方法

    研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。

  18. arXiv cs.AI23

    不同 LLM 如何影响信息 elicitation 智能体的开放式信息搜寻行为

    研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。

  19. arXiv cs.AI29

    关于 AI 智能体的可审计声明:arXiv 论文提出 Auditable Agents 框架

    arXiv 论文提出让 AI 智能体的声明变得可审计的方法:声明必须先明确其策略、范围、可据以判定的记录及记录撰写方,并在裁决前固定决策规则。该研究将 Auditable Agents 框架的 Policy Checkability 维度从单一动作扩展到声明,并针对智能体补充独立记录覆盖、动作参数授权绑定、超越完整性的完备性三项条件。

  20. arXiv cs.AI29

    MemCo:面向 LLM 智能体泛化到未见环境的记忆中心协作框架

    MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。