跳到正文
今天10月7日周三182 条
  1. arXiv cs.AI24

    长期记忆智能体的检索可采性验证:RHELM 与 MemOps 基准上 Top-20 锚点召回率从 0.432 提升至 0.533

    研究者提出检索可采性验证框架,为每个记忆-查询对分配可采、不可采或未决三种状态,并在 RHELM 和 MemOps 两个公开长期记忆基准的 3,767 条查询上做 Top-20 事后重分析,锚点召回率从 0.432 升至 0.533,80% 召回可行性从 0.237 升至 0.311,精确相似度评估减少 98.3%。

  2. arXiv cs.AI42

    NP-Bench 与调度规划器:验证并行编码智能体的协作

    研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。

  3. arXiv cs.AI32

    MemMux:面向并行编码智能体集群的运行时验证与资源归属

    MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。

  4. arXiv cs.AI22

    语义几何能否教会 AI 判断?四项研究未获可靠行动前判断

    一项 arXiv 研究用向量表示动作与策略,测试几何测量能否让 AI 智能体在行动前识别约束规则,四项研究均未建立可靠的行动前判断。最终合成研究中,词法路由器找回了全部管辖与阻断策略、将策略检查中位数减少 97.7%,但组合流水线仍升级了全部 2,304 个测试动作,包括本应放行的动作。作者据此修正假设:AI 智能体的判断需要构建后果图,该假设尚待验证。

  5. arXiv cs.AI36

    把 AI 编程助手放进虚拟身体:三十小时运行中它开始"玩耍"了吗?

    研究者将一款现代 AI 编程助手置于未知数字岛屿上的虚拟身体中,仅给出不含具体任务、奖励或活动的极简指令,机器便开始驱动身体行动。在三十小时的运行中,该具身智能体爬山、把方块堆成塔、画曼陀罗、重新诠释运动项目,并对自己世界的物理规律做实验,还习得后来扩展其能力的技巧。

  6. arXiv cs.AI24

    CuratorMAS:通过多智能体编排实现数据集自动策展

    CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。

  7. arXiv cs.AI22

    TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架

    TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。

  8. arXiv cs.AI34

    EPOCH:通过证据治理搜索实现可靠发现

    EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。

  9. arXiv cs.AI31

    SAGA:通过知识抽象实现 LLM 智能体自我进化

    针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。

  10. arXiv cs.AI36

    GameGo:用真实资产锚定的合成轨迹训练游戏开发智能体

    研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。

  11. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。

  2. AWS Machine Learning Blog26

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

10月5日周一
  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. arXiv cs.AI24

    用程序精化与 LLM 智能体发现认知算法

    研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。

  3. arXiv cs.CL32

    语言智能体为何无法将历史转化为经验:动作校准研究

    语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。

  4. arXiv cs.CV24

    基于仿真的智能体 VLM 框架用于野火监测与报告

    研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。

  5. arXiv cs.CL24

    EpiWorld:将 LLM 政策智能体锚定在流行病学世界模型中

    EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。

  6. arXiv cs.AI32

    OEB(Open-Endedness Bench):从智能体执行记录评测其认知过程

    研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。

  7. arXiv cs.CL22

    PlanPool 如何解决 Agentic Text-to-SQL 中的欠规范问题

    针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。

  8. arXiv cs.AI27

    MIRA:面向长时程研究智能体的元推理架构

    研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。