跳到正文
今天10月7日周三182 条
  1. arXiv cs.AI41

    从证据到行动:工具调用智能体为何失败

    研究揭示工具调用智能体在证据到行动链条上的失败模式:在十种模型-框架配置中,静态动作评估能力强,但交互式执行明显偏弱。失败常始于执行前——智能体调查不完整便停止,或在所需证据建立前就行动;一旦证据齐备,单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。

  2. arXiv cs.AI22

    加州葡萄园病害防控项目评估两种人机协作工作流:Aleks v1 多智能体系统与人工侦察的实地对比

    加州葡萄园精准病害防控项目评估了两种人机协作工作流。Workflow 1 中,多智能体研究系统 Aleks v1 在 145 分钟内开发出 vine-scale 预测模型,在回顾性模拟中对 45% 藤蔓位置进行侦察,模型辅助行优先级排序将新记录红叶观测的遇到比例从 85.8% 提升至 94.1%。

  3. arXiv cs.AI22

    SWORD:面向用户行为模拟的工作流与提示词联合优化框架

    SWORD 是一个联合优化多智能体工作流拓扑与自然语言提示词的框架,仅依靠标量任务指标引导,无需领域初始化或任务特定工程。在相同骨干模型的受控对比下,SWORD 相较仅提示词、仅工作流及分阶段优化基线均取得统计显著提升,并在使用更小骨干模型、更少训练数据和每数据集 4–6 美元 API 成本的情况下,准确率超过最强的已发表领域专用基线。

  4. arXiv cs.AI41

    SkillPoison:通过成功经验实现渐进式技能投毒

    研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。

  5. arXiv cs.AI15

    基础模型辅助的多智能体强化学习用于无线随机接入网络优化

    研究提出用基础模型(FM)提升多智能体强化学习(MARL)在无线随机接入(RA)网络优化中的效率,设计了基于共识的去中心化 MARL 架构下的 FM 辅助 actor-critic 算法。收敛性分析表明,该算法在局部奖励交换与非线性价值函数近似下,达到与传统 MARL 相同的收敛阶数。数值结果显示该方法显著提升了 RA 网络优化的 MARL 速度。

  6. arXiv cs.AI24

    异构 LLM 模拟中模型与人格的解耦研究

    研究用多个不同基础模型构建异构社交网络模拟,发现智能体获得的互动量更多取决于其基础模型而非被分配的人格。当混合的模型数量增加时,基础模型的吸引或排斥效应显著增强,暗示网络动态在大规模下可能收敛于基础模型效应。内容中介分析显示基础模型跨语境具有可预测性,且模型的词汇模式与互动最大化风格存在关联。

  7. arXiv cs.AI40

    Jarvis:面向多方对话的主动式语音智能体

    Jarvis 是一款能实时参与多人对话的主动式语音智能体,基于事先共享的文档跟进讨论,仅在群体遗漏或说错事实且数轮内未自我纠正时出声干预。它由小型开源权重模型驱动,结合确定性检查,并将每条论断锚定到原文句子。在 CHI-180-proactive 数据集上,Jarvis 对多数干预事件判断正确,且在群体自行解决问题时 97% 的情况下保持沉默;23 人实时研究验证了这一趋势。

  8. arXiv cs.AI32

    PlaySuite:面向交互式视觉智能的大规模基准

    研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。

  9. arXiv cs.AI37

    APEX:面向 LLM 智能体的执行边界主动防护

    APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。

  10. arXiv cs.AI44

    BOTTLED 基准:LLM 智能体能否把通用能力"装瓶"成廉价可复用方案?

    研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。

  11. arXiv cs.AI24

    智能体的历史行为能预测上下文压缩何时有害吗?TRACE 配对重放语料上的有限效应

    研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。

  12. arXiv cs.AI31

    ScienceClaw:跨自然科学与社会科学评测 AI-for-Science 智能体的持续自进化

    研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。

  13. arXiv cs.AI32

    ParanoiaEval:评测智能体编程中不必要的防御性工作

    研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。

  14. arXiv cs.AI41

    用 AI 辅助完成庞加莱猜想的 Lean 4 形式化

    研究团队完成了庞加莱猜想的 AI 辅助 Lean 4 形式化,项目起步时几何分析方向可复用的形式化基础设施十分有限。他们用数学家编写的证明蓝图配合明确的里程碑陈述来组织工作,使多个智能体可并行推进,并让数学家能定位阻塞点、给出有效数学指导。该工作分析了这一流程背后的人工介入与组织选择,为未来形式化项目提供了可复用基础设施的起点。

  15. arXiv cs.AI22

    MASC:面向心理咨询中一致客户角色扮演的多智能体自校准框架与潜在构念对齐

    研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。

  16. arXiv cs.AI37

    Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?

    研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。