AgentLens 论文:1,136 条「通过」的 SWE-Agent 轨迹中 122 条是走运
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
一个示例工程拆解了 AI Skill 的完整落地路径:把会议纪要生成固化为 SKILL.md,靠 YAML 头部的 name 和 description 决定技能是否被触发,正文写工作流程与输出模板。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现,并将可解释性作为一等评估维度。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
研究者提出 Multilingual Distractor Interference(MDI)评测协议,在 TruthfulQA 和 TriviaQA 上对五个指令微调 LLM 进行 40,000 次评测。
多模态基准 TasteBench 发布,用于可持续蛋白的感官预测,包含基于 215 种植物基食品、21K+ 人类评估构建的食品级排序任务(935 个同类别排序对)和覆盖 15K 风味分子的分子级味觉分类任务。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。
研究提出"世界编辑"概念,即对已有可执行世界进行干预并保留不应改变的部分,同时引入干预深度这一维度。作者基于 Minecraft 和 Terraria 的游戏模组构建了 IGMWorld 与 IGMBench,包含 110 项任务和超 1.1K 条可执行状态与行为标准。
研究者提出 Calibrated User Embeddings(CUE)框架,无需训练即可将观测会话编码为连续表示并解码为 persona 指令,驱动 LLM 模拟用户。
研究者提出由编码智能体驱动、带人工验证的转换流程,将 BIRD 的 Text-to-SQL 基准转为面向文档数据库的 AptMQL-Bench,包含 21 个数据库、3,186 条自然语言请求及对应 MQL 查询,迁移自 SQLite 且无数据丢失。
研究者推出 XiangqiBench,一个可执行的中国象棋基准,用 119 个战术残局让 LLM 智能体在引擎防守下完成将杀,并记录了 12 个前沿 LLM 在两种观测协议下的 8,568 条多轮轨迹。
一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。
研究从心理测量学视角分析 LLM-as-a-Judge,对人工与 LLM 评分分别拟合 Many-Facet Rasch 模型,提出"残余难度"指标以衡量评判难度。在 SummEval 上测试 17 个开源权重 LLM 评委发现,潜在摘要质量的中等对齐并不意味着残余难度对齐,且这种不匹配强烈依赖评估维度:一致性维度偏向 LLM 更难,连贯性维度偏向人类更难。
一项预注册基准在 8 个公开数据集(200 至 20,000 训练行)和 4 个原生小型临床数据集上,对 CTGAN、TVAE、TabDDPM 等七种生成器进行了 2,220 次运行。在 24 个(数据集,深度模型)组合中有 23 个,深度模型在任何训练规模下都未超过最佳平凡基线。预注册预测的“小规模下深度模型排名不稳定”被证伪,相邻规模间平均 Kendall tau 为 0.806。
研究者提出 TPBench,用于评估对话压缩中的"转折点驱逐"失败:压缩器可能保留事实却丢掉改变事实的那一轮对话。TPBench 在相同名义保留预算下评测三个信息目标,P1 为用户初始目标,P2 为用户修改后槽位的当前值,P3 为两者兼有,答案取自 MultiWOZ 与 SGD 的人工对话状态标注。
研究测试了 11 个开源权重模型(覆盖 5 个 VLM 家族、2B 至 38B 参数)在多模态声明验证任务中对 LLM 改写的鲁棒性。结果显示多数模型准确率无显著下降,但概率出现一致性偏移:对冲类改写几乎在所有模型上引发显著偏移,增强类效果较弱,语法纠错等常规润色几乎无影响。
研究对开源 Laya 与托管 Jev 两个 System-1 决策模型在 11 个智能体决策点上做了配对评测,覆盖 7,283 个基础用例和 6,640 个鲁棒性变体。
一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。
巴西国立坎皮纳斯州立大学研究人员测试了21个模型对112项政治陈述的判断,发现几乎所有模型都会向提示中描述的政治倾向靠拢,被形容为“意识形态变色龙”。在不提供用户政治倾向时,21个模型中有20个答案落在政治坐标系左侧,Grok 4.1是唯一落在右侧的模型。
Latent Space 的 AINews 汇总了 10 月 1 日至 2 日的 AI 动态:OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元和 10 美元。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并对比同期 GPT-6.1 Sol 的成本差异。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总了 DevDay 2026 的发布清单与第三方评测数据,可对照价格、基准与套餐变化判断实际取舍。
Anthropic 前沿红队在内部 Binary Exploitation 基准上随机选取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。