跳到正文
今天10月7日周三230 条
  1. arXiv cs.LG32

    语言模型能从测试时计算中获得多少收益?SELF-POT 基准给出量化答案

    研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。

  2. arXiv cs.CL29

    Turnslide:用有限状态机实现可扩展多轮数据合成

    Turnslide 是一个全自动轻量级多轮工具调用数据合成框架,将每个 API 建模为有限状态机,用单次 LLM 调用把状态合法的工具序列翻译成完整训练样本。在 SLM 微调实验中,其生成轨迹的下游完整准确率达 70.7%,高于对比方法的 63.4% 和 53.7%,且 token 用量减少 3.6-6.6 倍。该工作已被 NeurIPS 2026 SLM-Agents Workshop 接收。

  3. arXiv cs.LG31

    HARL-A:基于 IsaacLab 的可扩展异构多智能体对抗强化学习基准框架

    HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。

  4. arXiv cs.LG29

    Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线

    Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。

  5. arXiv cs.LG22

    CASTLE:基于反事实语义-社会世界模型的独立多智能体强化学习

    CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。

  6. arXiv cs.LG34

    Fork-and-Flush:让 Autoresearch 智能体逃离「想法盆地」

    研究发现,同一 Autoresearch 智能体在相同任务上的独立运行常停滞在分数差异明显的「想法盆地」中,即使追加大量算力差距仍持续。为此提出的 fork-and-flush 方法将智能体分叉为多条并行轨迹,各自继承累积工作区但使用全新对话上下文,运行固定时长后从得分最高的轨迹继续。

  7. arXiv cs.LG31

    ResearchTrails:从人类研究决策轨迹中学习科学探索

    研究者构建了 ResearchTrails 数据集,从 Git 仓库的 commit 历史中提取结构化的人类研究轨迹,作为科学探索过程的代理,捕捉方法、实验与消融的连续变化。该数据集包含论文最终结果之外的中间研究决策信号,可用于在测试时检索人类研究经验作为外部技能,以及训练模型以提升对新研究决策的泛化能力。

  8. arXiv cs.AI32

    LLM 智能体为何过度调用工具:诊断内在过度调用偏差

    研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。

  9. arXiv cs.AI27

    DMAST:双模态多阶段对抗安全训练让多模态 Web Agent 抵御跨模态攻击

    针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。

  10. arXiv cs.AI28

    ReLoop:面向可靠 LLM 优化的结构化建模与行为验证

    ReLoop 通过结构化生成与行为验证两项机制,解决 LLM 生成优化代码时"可求解但语义错误"的静默失败问题。结构化生成将代码生产拆为理解、形式化、合成、验证四阶段,在 RetailOpt-190 上配合 Claude Opus 4.6 提升 8.5pp 准确率;行为验证借助求解器参数扰动检测残留错误,在 MAMO-ComplexLP 上提升 4.4pp。

  11. arXiv cs.AI42

    MiniScope:用最小权限为 AI 智能体授权

    研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。

  12. arXiv cs.AI35

    Speak to a Protein:交互式多模态蛋白质研究 AI 协同科学家

    Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。

  13. arXiv cs.AI51

    TasteVal:用算力效率衡量 AI 系统的实验研究品味

    研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。

  14. arXiv cs.AI22

    用结构化 CoT 提升 AI 空间智能:GPT-5.6 的 3D 旋转可视化与推理

    研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。

  15. arXiv cs.AI27

    GraphMemory:将记忆与上下文解耦的 token 高效测试时持续学习结构化记忆

    研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。

  16. arXiv cs.AI31

    MLToolBench:为机器学习开发训练工具增强智能体

    研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。

  17. arXiv cs.AI37

    AX 是新的 AEO:AI 智能体时代网站可读性比被提及更重要

    研究提出"智能体体验(AX)"是新的 AEO:在 1,056 家真实企业上运行 37,927 次智能体购买旅程后发现,仅 7-10% 的最终答案来自模型训练知识。具备 AX 的企业有 78% 的答案由自家页面构建(对照组 56%),被明确推荐的概率高 1.9 倍;而不可读企业获得有据答案的成本平均高 64%。主要失败并非编造而是遗漏——网页构建的答案缺失买家所需事实的概率高 3.7 倍。

  18. arXiv cs.AI22

    用校准良好的 Deep Ensemble 替代高斯过程,提升水上溢油监测的路径规划效果

    针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。