跳到正文
今天10月6日周二2 条
10月5日周一
  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. arXiv cs.AI24

    用程序精化与 LLM 智能体发现认知算法

    研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。

  3. arXiv cs.CL32

    语言智能体为何无法将历史转化为经验:动作校准研究

    语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。

  4. arXiv cs.CV24

    基于仿真的智能体 VLM 框架用于野火监测与报告

    研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。

  5. arXiv cs.CL24

    EpiWorld:将 LLM 政策智能体锚定在流行病学世界模型中

    EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。

  6. arXiv cs.AI32

    OEB(Open-Endedness Bench):从智能体执行记录评测其认知过程

    研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。

  7. arXiv cs.CL22

    PlanPool 如何解决 Agentic Text-to-SQL 中的欠规范问题

    针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。

  8. arXiv cs.AI27

    MIRA:面向长时程研究智能体的元推理架构

    研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。

  9. arXiv cs.CL29

    APDMem:面向查询自适应的智能体渐进式披露长期记忆架构

    APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。

  10. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  11. arXiv cs.LG22

    MACTS-EM:多智能体协作时间序列预测框架,引入涌现记忆机制

    研究者提出 MACTS-EM 多智能体协作时间序列预测框架,通过领域专用预测智能体、元认知层动态分配、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件协同工作。在金融市场、气候模式、能源消耗和疫情传播等场景评测中,该框架预测准确率提升 8-12%,零样本迁移能力提升 22-27%,regime shifts 期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。

  12. arXiv stat.ML24

    GTDD:面向 AI 编程智能体的生成式测试驱动开发与对抗测试

    研究者提出生成式测试驱动开发(GTDD),由独立的测试智能体在每次候选实现固定后,依据人类指定的行为契约与历史反馈生成新输入,可信评估器校验并返回精简反例供回归测试。在有状态键值存储的配对实验中,开发过程中重新生成测试的策略平均失败率低于仅用同一语言模型一次性生成测试的策略,而向测试方提供候选源码未带来可检测的额外提升。

  13. arXiv cs.AI31

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。

  14. arXiv cs.CV24

    MeshQuery:用智能体做 UV 展开的接缝规划

    MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。

10月4日周日
7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。