LLM-as-a-Judge 的设计选择影响有多大?提示词、评分量表与模型的系统对比
研究系统评估了 10 个推理模型在 LLM-as-a-Judge 中的设计选择影响,涵盖句子情感与毒性评分(每类超 500 条)及问答对二元准确率分类(n=600)两项任务。
研究系统评估了 10 个推理模型在 LLM-as-a-Judge 中的设计选择影响,涵盖句子情感与毒性评分(每类超 500 条)及问答对二元准确率分类(n=600)两项任务。
研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。
研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。
研究者推出 WorldSolver 基准,包含 168 个源自 61 篇经典计算机图形学论文的仿真任务,覆盖 7 个物理领域,要求 LLM 智能体补全求解器代码。评测从执行检查、视觉保真度和物理合理性三个维度展开,GPT-5.6-Sol 与 Claude-Opus-5 表现相对最好,总分仅为 48.7% 和 46.7%。
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
Recursive Game Creator 是一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件构成递归开发闭环,将游戏原型迭代为可玩性更高的成品。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。
ChartBmkAgent 能从稀疏的错误分类规范出发,通过中央 harness 治理多个专用智能体,构建完整的 Chart QA 诊断样本,并要求每个阶段提供与原始错误类别对齐的证据。
研究者推出 DSV-Mem 基准,用于评估 MLLM 智能体的密集有状态视觉记忆,包含专家审核场景和 1000 道题,覆盖 Current State、Past State、Derived State、Change History、Conflict/Refusal 五类。
研究者推出 SPEEDRUNBENCH,一个覆盖 9 款游戏、评估前沿 LLM 智能体策略形成能力的基准,要求智能体反复改进策略、反思表现并长程推理,以不断超越自己和他人。实验显示,前沿智能体在简单平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类。该基准因几乎总存在更快的通关时间而具备抗饱和特性。
一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。
研究提出 PAIR 流水线构建用户条件化应用状态,并推出 RePAIR 训练方法,从跨用户子目标结果差异中学习以提升可靠性。在六款智能体上,用户条件化 UI 中任务成功率下降 6.98 至 15.4 个百分点,涉及用户个人内容时差距扩大至 8.77 至 22.0 个百分点。RePAIR 在未见用户上将整体 Task SR 提升 9.42 个百分点。
研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。
研究者推出 ST-Bench,用于检验 LLM 多智能体系统(MAS)在真实科学数据分析中是否优于单智能体。该基准含 100 个源自地球科学研究的数据科学任务,扩展为 2,067 条查询,在 GPT-5 上评测五种 MAS 生成方法。十种 MAS 配置中九种超过最便宜的单智能体基线,最强配置综合得分接近其三倍,但推理时间约为四倍;更经济的方案以不到两倍成本获得大部分收益。
研究者提出 VisualNoiseQA,一个面向噪声视觉反馈下主动推理的基准:纯文本 LLM 需通过迭代查询一个固定的现成 VLM(视为随机视觉传感器)来解答 VQA 问题,每次查询多次采样并以自一致性给出经验不确定性信号,供推理器决定下一步问什么、何时停止。
EIO-Agents 是一个面向可互操作 AI 智能体评估的开放规范,由语义层 EIO 与记录系统 PER 两层构成。EIO 通过类型化证据、版本化行为谓词、证据契约、声明、见证规则、证明状态与可计算推导,支撑指标、发现、控制及 PASS、REVIEW、BLOCK 决策;PER 则以内容寻址方式保存单次评估的证据到决策链,可重新推导、解释与验证。
研究者推出 BioStudyBench,用 25 个长周期分析任务评估 AI 智能体能否仅凭公开数据复现 2026 年 7 至 9 月发表的生物医学研究结论,这些研究均晚于被测模型的知识截止时间。
研究者发布 LOGIC,一个用于航空航天电气设计变更影响分析的 LLM 基准与评估框架,包含 168 个场景(144 个选择案例、24 个弃答案例),让本地部署模型先在确定性候选变更清单中完成意图定位,再经类型化电气追溯图传播。
一项系统性研究考察了 LLM 在广告相关性判断中的公平性,测试对象为 GPT-4o 和专为相关性预测训练的 Qwen-7B。研究发现,改变广告主身份或输入语言会改变两个模型的相关性评估,部分人口统计比较还显示出与性别和职业刻板印象一致的模式。研究进一步考察了推理和训练阶段的缓解措施,其效果取决于广告主信息是否与查询相关以及训练数据中广告主标签的分布。
研究人员推出 2D-FET-Bench V2,一个基于显微薄片轮廓构建的 128 项 FET 版图任务基准,用于测试语言模型智能体能否完成薄片专属的器件构造。
研究测试语义熵作为 LLM 路由升级信号,在 GSM8K 上以约 12 倍规模差的小/大模型组合实现 AUROC 0.871,同等成本下路由准确率较随机升级最高提升 9 个百分点。作者指出合成基准上的亮眼结果实为假象:仅基于问题难度的无模型规则几乎完全匹配语义熵,并据此提出一套检查清单,涵盖难度对照、升级成功定义分歧、基准天花板及实时采样真实成本等陷阱。
研究者提出面向 Agent 评测的 Trust Layer,在记录分数旁标注该分数是否可信,核查结果是否有评测评分逻辑支撑、通过答案是否来自可追溯计算、完成声明是否与实际相符、以及重复执行下是否稳定。
研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。
EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自有的 3800 块 NVIDIA Grace Blackwell GPU 集群上训练,目前通过其 API 提供。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
SemiAnalysis 通过逐项隔离 token 类型的实验测算各订阅计划的 API 等价价值,发现 Anthropic 在中端模型上提供的价值约为 OpenAI 的 5 倍。OpenAI 上周将 200 美元计划的 API 等价价值减半并新增 500 美元档位,导致 Sol 级模型价值下降超 50%。Anthropic 则通过降低高端模型的订阅价值来减少补贴,而非直接削减限额。
Agent 可靠性评测需区分 pass@k(k 次至少成功一次)与 pass^k(k 次全部成功)两类指标,前者适合可挑候选的场景,后者衡量重复交付的稳定性。故障恢复应单独建回归集,按故障类型和位置组织用例,不能与自然任务混算统一成功率。成本与延迟须随结果一并记录,包括输入输出 token、工具调用数、实际费用和失败尝试消耗的资源。
文章提出用 cost-per-success(总花费除以成功次数)替代榜单分数做模型选型,并给出可复现的 OpenAI 兼容接口评测脚本。
Reflection AI 发布首个开放权重模型 Beam,采用稀疏激活架构,总参数 501B、每 token 激活 23B,在 23.8 万亿 token 上预训练,4 周内完成且 Goodput 达 92.3%。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
一个示例工程拆解了 AI Skill 的完整落地路径:把会议纪要生成固化为 SKILL.md,靠 YAML 头部的 name 和 description 决定技能是否被触发,正文写工作流程与输出模板。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现,并将可解释性作为一等评估维度。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
研究者提出 Multilingual Distractor Interference(MDI)评测协议,在 TruthfulQA 和 TriviaQA 上对五个指令微调 LLM 进行 40,000 次评测。