跳到正文
今天10月6日周二3 条
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。

  2. AWS Machine Learning Blog26

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

10月5日周一
  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. arXiv cs.AI24

    用程序精化与 LLM 智能体发现认知算法

    研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。

  3. arXiv cs.CL32

    语言智能体为何无法将历史转化为经验:动作校准研究

    语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。

  4. arXiv cs.CV24

    基于仿真的智能体 VLM 框架用于野火监测与报告

    研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。

  5. arXiv cs.CL24

    EpiWorld:将 LLM 政策智能体锚定在流行病学世界模型中

    EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。

  6. arXiv cs.AI32

    OEB(Open-Endedness Bench):从智能体执行记录评测其认知过程

    研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。

  7. arXiv cs.CL22

    PlanPool 如何解决 Agentic Text-to-SQL 中的欠规范问题

    针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。

  8. arXiv cs.AI27

    MIRA:面向长时程研究智能体的元推理架构

    研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。

  9. arXiv cs.CL29

    APDMem:面向查询自适应的智能体渐进式披露长期记忆架构

    APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。

  10. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  11. arXiv cs.LG22

    MACTS-EM:多智能体协作时间序列预测框架,引入涌现记忆机制

    研究者提出 MACTS-EM 多智能体协作时间序列预测框架,通过领域专用预测智能体、元认知层动态分配、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件协同工作。在金融市场、气候模式、能源消耗和疫情传播等场景评测中,该框架预测准确率提升 8-12%,零样本迁移能力提升 22-27%,regime shifts 期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。

  12. arXiv stat.ML24

    GTDD:面向 AI 编程智能体的生成式测试驱动开发与对抗测试

    研究者提出生成式测试驱动开发(GTDD),由独立的测试智能体在每次候选实现固定后,依据人类指定的行为契约与历史反馈生成新输入,可信评估器校验并返回精简反例供回归测试。在有状态键值存储的配对实验中,开发过程中重新生成测试的策略平均失败率低于仅用同一语言模型一次性生成测试的策略,而向测试方提供候选源码未带来可检测的额外提升。

  13. arXiv cs.AI31

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。

  14. arXiv cs.CV24

    MeshQuery:用智能体做 UV 展开的接缝规划

    MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 智能体而非仅使用它、不要轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

10月1日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
9月29日周二
  1. Microsoft Research18

    微软亚洲研究院新加坡成立一周年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。实验室与新加坡医疗生态伙伴合作探索多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 自主模糊测试流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 公开了自主模糊测试流水线的架构与运行方式,读者可了解 LLM 智能体如何接管覆盖率反馈与崩溃分诊。