跳到正文
今天10月7日周三107 条
  1. arXiv cs.AI44

    BOTTLED 基准:LLM 智能体能否把通用能力"装瓶"成廉价可复用方案?

    研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。

  2. arXiv cs.AI24

    智能体的历史行为能预测上下文压缩何时有害吗?TRACE 配对重放语料上的有限效应

    研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。

  3. arXiv cs.AI32

    ParanoiaEval:评测智能体编程中不必要的防御性工作

    研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。

  4. arXiv cs.AI37

    Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?

    研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。

  5. arXiv cs.AI31

    SpeedrunBench:用视频游戏速通挑战 LLM 智能体

    研究者推出 SPEEDRUNBENCH,一个覆盖 9 款游戏、评估前沿 LLM 智能体策略形成能力的基准,要求智能体反复改进策略、反思表现并长程推理,以不断超越自己和他人。实验显示,前沿智能体在简单平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类。该基准因几乎总存在更快的通关时间而具备抗饱和特性。

  6. arXiv cs.AI29

    同一反馈不同答案:前沿模型客户反馈分析中的运行间不稳定性

    一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。

  7. arXiv cs.AI24

    移动 GUI 智能体能否服务所有用户?PAIR 与 RePAIR 揭示跨用户可靠性差异

    研究提出 PAIR 流水线构建用户条件化应用状态,并推出 RePAIR 训练方法,从跨用户子目标结果差异中学习以提升可靠性。在六款智能体上,用户条件化 UI 中任务成功率下降 6.98 至 15.4 个百分点,涉及用户个人内容时差距扩大至 8.77 至 22.0 个百分点。RePAIR 在未见用户上将整体 Task SR 提升 9.42 个百分点。

  8. arXiv cs.AI24

    OTel:开放电信 AI 数据集、基准与模型发布

    研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。

  9. arXiv cs.AI29

    ST-Bench:面向科研任务多智能体系统生成的空间-时间基准

    研究者推出 ST-Bench,用于检验 LLM 多智能体系统(MAS)在真实科学数据分析中是否优于单智能体。该基准含 100 个源自地球科学研究的数据科学任务,扩展为 2,067 条查询,在 GPT-5 上评测五种 MAS 生成方法。十种 MAS 配置中九种超过最便宜的单智能体基线,最强配置综合得分接近其三倍,但推理时间约为四倍;更经济的方案以不到两倍成本获得大部分收益。

  10. arXiv cs.AI24

    EIO-Agents:为 AI 智能体评估补上缺失的语义层

    EIO-Agents 是一个面向可互操作 AI 智能体评估的开放规范,由语义层 EIO 与记录系统 PER 两层构成。EIO 通过类型化证据、版本化行为谓词、证据契约、声明、见证规则、证明状态与可计算推导,支撑指标、发现、控制及 PASS、REVIEW、BLOCK 决策;PER 则以内容寻址方式保存单次评估的证据到决策链,可重新推导、解释与验证。

  11. arXiv cs.AI24

    广告相关性判断中的 LLM 偏见:GPT-4o 与 Qwen-7B 的系统性研究

    一项系统性研究考察了 LLM 在广告相关性判断中的公平性,测试对象为 GPT-4o 和专为相关性预测训练的 Qwen-7B。研究发现,改变广告主身份或输入语言会改变两个模型的相关性评估,部分人口统计比较还显示出与性别和职业刻板印象一致的模式。研究进一步考察了推理和训练阶段的缓解措施,其效果取决于广告主信息是否与查询相关以及训练数据中广告主标签的分布。

  12. arXiv cs.AI31

    评估 LLM 路由的升级信号:目标、对照与五种自欺方式

    研究测试语义熵作为 LLM 路由升级信号,在 GSM8K 上以约 12 倍规模差的小/大模型组合实现 AUROC 0.871,同等成本下路由准确率较随机升级最高提升 9 个百分点。作者指出合成基准上的亮眼结果实为假象:仅基于问题难度的无模型规则几乎完全匹配语义熵,并据此提出一套检查清单,涵盖难度对照、升级成功定义分歧、基准天花板及实时采样真实成本等陷阱。

  13. arXiv cs.AI42

    NP-Bench 与调度规划器:验证并行编码智能体的协作

    研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。

  14. arXiv cs.AI34

    EPOCH:通过证据治理搜索实现可靠发现

    EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。

  15. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
  1. Hacker News62

    SemiAnalysis:Anthropic 订阅价值是 OpenAI 的 5 倍以上

    SemiAnalysis 通过逐项隔离 token 类型的实验测算各订阅计划的 API 等价价值,发现 Anthropic 在中端模型上提供的价值约为 OpenAI 的 5 倍。OpenAI 上周将 200 美元计划的 API 等价价值减半并新增 500 美元档位,导致 Sol 级模型价值下降超 50%。Anthropic 则通过降低高端模型的订阅价值来减少补贴,而非直接削减限额。

  2. 掘金38

    Agent 系统工程 09:Agent 的可靠性怎么测?成功率、恢复能力与成本

    Agent 可靠性评测需区分 pass@k(k 次至少成功一次)与 pass^k(k 次全部成功)两类指标,前者适合可挑候选的场景,后者衡量重复交付的稳定性。故障恢复应单独建回归集,按故障类型和位置组织用例,不能与自然任务混算统一成功率。成本与延迟须随结果一并记录,包括输入输出 token、工具调用数、实际费用和失败尝试消耗的资源。

10月5日周一
  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. arXiv cs.CL15

    HakemBench:土耳其语类型化决策基准发布

    HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。

  3. arXiv cs.LG27

    PowerBench:衡量语言模型在权力转移请求中的偏见

    研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。