跳到正文
今天10月7日周三231 条
  1. arXiv cs.AI24

    移动 GUI 智能体能否服务所有用户?PAIR 与 RePAIR 揭示跨用户可靠性差异

    研究提出 PAIR 流水线构建用户条件化应用状态,并推出 RePAIR 训练方法,从跨用户子目标结果差异中学习以提升可靠性。在六款智能体上,用户条件化 UI 中任务成功率下降 6.98 至 15.4 个百分点,涉及用户个人内容时差距扩大至 8.77 至 22.0 个百分点。RePAIR 在未见用户上将整体 Task SR 提升 9.42 个百分点。

  2. arXiv cs.AI26

    Confidence Reasoning Graphs:面向 LLM 智能体的结构化置信度估计

    研究者提出 Confidence Reasoning Graphs(CRG),一种推理时框架,仅凭单条轨迹即可估计 LLM 智能体完成任务的成功概率,无需模型内部信号或训练数据。CRG 将任务声明分解为基于轨迹证据的子声明,逐项估计置信度后再聚合为整体置信度。在三个智能体基准、三个骨干模型和三个智能体框架上,CRG 的置信度校准与风险感知决策均优于口头表达、采样和白盒代理基线。

  3. arXiv cs.AI22

    ShanLiangRen:面向个性化每日膳食规划的 AI 营养智能体

    研究团队提出个性化全量化多目标膳食规划问题(MDP),并开发营养智能体 ShanLiangRen。该系统将饮食规格、营养数据、用户属性与自然语言需求转化为个性化约束规划实例,通过精确检索增强生成缩小候选食材与食谱范围,再由 LLM 在确定性营养计算和约束校验反馈下按 Pareto 原则迭代优化方案。系统输出含明确食材与分量的全量化餐食计划及营养合规报告,已以微信小程序形式上线。

  4. arXiv cs.AI26

    自参照社会偏好:不观察他人奖励也能学会合作

    研究者提出"自参照社会偏好"方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测轨迹,从自身视角评估对方结果,再接入标准社会偏好机制。在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中,智能体无需观察他人奖励即可学会合作,甚至在独立学习失败的环境中也能实现合作,且收益分配常比能获取真实奖励的智能体更公平。

  5. arXiv cs.AI32

    WorkflowOps:为多智能体工作流编排学习智能体协作先验

    WorkflowOps 是一个多智能体工作流编排框架,能从历史工作流中学习智能体协作先验,并按需扩展智能体池以覆盖新能力需求。它通过转移概率矩阵引导 DAG 工作流构建,并用分层语义匹配策略将 LLM 路由调用减少超 80%。在代码、数学与问答混合测试集上,其端到端通过率优于近期工作流构建基线,在结构化可分解任务上提升最大。

  6. arXiv cs.AI27

    DHCG:为基于 LLM 的多智能体推理动态构建分层协作图

    DHCG 框架通过 Planner、Worker、Generator 三个模块,从零逐步构建动态分层协作图,并支持提前终止或按需扩展。在代码生成、数学推理等基准上,其平均性能较单智能体基线提升 13.06 分,优于静态与动态 MAS 基线 2.77-8.02 分。该框架还引入动作感知偏好优化训练 Planner,并展现出跨 Planner 主干与未见 Worker 模型的泛化能力。

  7. arXiv cs.AI29

    OOPMAS:面向查询级工作流生成的面向对象多智能体系统

    OOPMAS 是一个免训练框架,能在单个查询粒度上同时生成智能体集合与协调工作流,智能体以面向对象类定义表示,工作流则表达为可执行 main 函数。在覆盖代码、数学与问答的混合任务基准上,OOPMAS 达到 89.6% 准确率,超出最强基线 18.1 个百分点;跨四个 LLM 基座的模型替换研究显示性能一致扩展,最强模型下达到 92.4%。

  8. arXiv cs.AI29

    ST-Bench:面向科研任务多智能体系统生成的空间-时间基准

    研究者推出 ST-Bench,用于检验 LLM 多智能体系统(MAS)在真实科学数据分析中是否优于单智能体。该基准含 100 个源自地球科学研究的数据科学任务,扩展为 2,067 条查询,在 GPT-5 上评测五种 MAS 生成方法。十种 MAS 配置中九种超过最便宜的单智能体基线,最强配置综合得分接近其三倍,但推理时间约为四倍;更经济的方案以不到两倍成本获得大部分收益。

  9. arXiv cs.AI37

    AgentMemGate:解决对话助手记忆中的推测污染问题

    AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。

  10. arXiv cs.AI24

    EIO-Agents:为 AI 智能体评估补上缺失的语义层

    EIO-Agents 是一个面向可互操作 AI 智能体评估的开放规范,由语义层 EIO 与记录系统 PER 两层构成。EIO 通过类型化证据、版本化行为谓词、证据契约、声明、见证规则、证明状态与可计算推导,支撑指标、发现、控制及 PASS、REVIEW、BLOCK 决策;PER 则以内容寻址方式保存单次评估的证据到决策链,可重新推导、解释与验证。

  11. arXiv cs.AI26

    规则止于何处,裁判始于何处:测量多智能体系统安全中的判断边界

    研究将 LLM 多智能体系统(MAS)的防御组织为五项原则并实现为 DEFER1,包含 28 项检查的级联,能拦截的拦截、其余交给四人评审团。在四个领域的独立测试中,攻击成功率从约 30.0% 降至约 3.0%,78% 被拦截的攻击由确定性检查处理。安全运营领域仅四分之一提案会到达评审团,但风险评分审批门会错误放行多数攻击提案、却只放行少数合法提案。

  12. arXiv cs.AI22

    个人智能体中介推荐:跨平台用户历史如何平衡平台排序的救援与误改

    研究提出"个人智能体中介推荐"范式:平台推荐器用本地信息排序候选集,个人 LLM 智能体借助用户授权的跨平台历史对排序进行中介,生成最终 top-K 列表。为此推出 MediateRec 基准,并给出 Personal Attribution Mediation Optimization(PAMO)训练方法,通过反事实遮蔽跨平台历史来估计个人中介支持度。

  13. arXiv cs.AI19

    交错参与下的多智能体强化学习:SPL 训练增强方法

    研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。

  14. arXiv cs.AI23

    不同 LLM 如何影响信息 elicitation 智能体的开放式信息搜寻行为

    研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。

  15. arXiv cs.AI29

    关于 AI 智能体的可审计声明:arXiv 论文提出 Auditable Agents 框架

    arXiv 论文提出让 AI 智能体的声明变得可审计的方法:声明必须先明确其策略、范围、可据以判定的记录及记录撰写方,并在裁决前固定决策规则。该研究将 Auditable Agents 框架的 Policy Checkability 维度从单一动作扩展到声明,并针对智能体补充独立记录覆盖、动作参数授权绑定、超越完整性的完备性三项条件。

  16. arXiv cs.AI29

    MemCo:面向 LLM 智能体泛化到未见环境的记忆中心协作框架

    MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。

  17. arXiv cs.AI24

    长期记忆智能体的检索可采性验证:RHELM 与 MemOps 基准上 Top-20 锚点召回率从 0.432 提升至 0.533

    研究者提出检索可采性验证框架,为每个记忆-查询对分配可采、不可采或未决三种状态,并在 RHELM 和 MemOps 两个公开长期记忆基准的 3,767 条查询上做 Top-20 事后重分析,锚点召回率从 0.432 升至 0.533,80% 召回可行性从 0.237 升至 0.311,精确相似度评估减少 98.3%。

  18. arXiv cs.AI42

    NP-Bench 与调度规划器:验证并行编码智能体的协作

    研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。

  19. arXiv cs.AI32

    MemMux:面向并行编码智能体集群的运行时验证与资源归属

    MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。

  20. arXiv cs.AI22

    语义几何能否教会 AI 判断?四项研究未获可靠行动前判断

    一项 arXiv 研究用向量表示动作与策略,测试几何测量能否让 AI 智能体在行动前识别约束规则,四项研究均未建立可靠的行动前判断。最终合成研究中,词法路由器找回了全部管辖与阻断策略、将策略检查中位数减少 97.7%,但组合流水线仍升级了全部 2,304 个测试动作,包括本应放行的动作。作者据此修正假设:AI 智能体的判断需要构建后果图,该假设尚待验证。

  21. arXiv cs.AI36

    把 AI 编程助手放进虚拟身体:三十小时运行中它开始"玩耍"了吗?

    研究者将一款现代 AI 编程助手置于未知数字岛屿上的虚拟身体中,仅给出不含具体任务、奖励或活动的极简指令,机器便开始驱动身体行动。在三十小时的运行中,该具身智能体爬山、把方块堆成塔、画曼陀罗、重新诠释运动项目,并对自己世界的物理规律做实验,还习得后来扩展其能力的技巧。

  22. arXiv cs.AI24

    CuratorMAS:通过多智能体编排实现数据集自动策展

    CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。