什么是 Fréchet 距离?一种方向性分解方法
研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。
研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。
研究者推出 DecepEval 基准,包含 3 类任务家族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类外部条件,并通过中性版与诱导版配对测量欺骗率变化。
一项被 NeurIPS 2026 预训练到后训练 Workshop 接收的研究指出,pass@k 只依赖问题被答对的概率,无法反映答案分布。用 GRPO 和 RFT 训练 Qwen2.5-1.5B-Instruct 后,三项多样性指标走向相反,GRPO 正确解的词法多样性低 15%,但 pass@8 和 pass@32 在 GSM8K 上无一致赢家,仅在低 k 时出现分离。
研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬资源约束下满足预算并自适应重分配未用预算的 LLM 评测预算分配方法。
研究对 4 个从零训练的模型和 4 个时间序列基础模型(TSFM)在 3 个真实负荷预测数据集上进行了基准测试,考察未来协变量信息可用性与质量不同的运行场景。结果显示 Chronos-2 在协变量可用或预测准确时,零样本和微调设置下均持续达到 SOTA,但随着协变量预测噪声增大性能下降,而 TimesNet 在严重协变量不确定性下表现更稳健。
一项审计发现,GNN 在常用时空预测基准上的表现并不一致,重新评估时间线性基线后,GNN 在多个基准上的增益大幅缩水,在部分基准上甚至被线性基线超越。为 GNN 提供自回归残差可提升其表现,尤其在非交通类基准上;合成实验显示 GNN 对时间动态与空间图交互的异质性较为敏感。
研究提出 Relative Taylor Debiasing(RTD)算法,用于估计生成模型评测指标 FID,达到 O(d/ε²) 的样本复杂度并证明其最优性。
研究将 LLM 评委的评测机制近似为一类 Markov GLMM,并在三个主流商用 LLM 上通过样本外预测验证。基于一阶 Markov GLMM 的分析显示,随机化提示词顺序再取平均的排行榜选择在温和分离条件下具有一致性,Williams 方设计可在项目质量接近时提升效率;而分组比较中,由于响应模型的非线性,简单平均可能得出关于组间质量差异的不一致结论。
一项受控实验用 30 个工件、150 个植入错误、10 种审查条件和 900 次审查会话,测试了来自两家开发商的三个审查模型。顶级跨模型审查者的 F1 与同模型新会话审查(CCR)无显著差异,但两者发现的错误仅部分重叠(Jaccard 41.2%)。
KlinikeBench 是一个包含 333 个临床医生编写任务的基准,每个任务提供虚拟患者、临床工具和任务专属成功标准,超过 35 位临床医生参与编写与评估。
一项研究用十个月欧洲地面观测数据,将 12 个物理与 AI 预报模型对照 ECMWF IFS 评估,覆盖 10 m 风速、2 m 气温、太阳辐射和降水。结果显示 AI 模型在极端条件下并无统一的尾部劣势:部分 AI 模型比 IFS 更准,另一些则明显退化,物理模型间也存在类似差异。所有模型都表现出高值低估、低值高估的共同条件误差模式,尾部表现取决于模型、变量和评估设置,而非是否由 AI 生成。
研究提出一个受控基准,用有序规划操作刻画 LLM 智能体在信息物理系统中的控制轨迹,由 Llama-3.3-70B 在 40 个产消者的辐射状馈线上执行需求响应实验。
研究者推出 3D-DefectBench,用覆盖几何、纹理与提示词遵循的九类细粒度二元缺陷评估 3D 生成,并跨 84 种推理设计对 VLM、相机协议、视觉输入与提示词方案做析因分析。
研究者提出 SPATIALUNCERTAIN 评测框架,用遮挡造成的证据缺失和透视造成的误导证据两类场景,考察视觉语言模型能否判断当前视角是否可靠。在八个开源与闭源 VLM 上,模型行为并不跟随视觉证据的可靠性:证据消失时不会更谨慎,透视冲突时判断更依赖投影外观而非未变的物理 3D 关系。
PBT-Bench 是一个覆盖 40 个真实 Python 库、100 道基于属性测试题的基准,每题注入语义 bug 共 365 个(平均 3.65 个),默认随机输入几乎无法触发。
针对 LLM 作为自动评估器时偏爱自身输出的"自我偏好偏差",研究者提出在推理阶段用轻量引导向量(steering vectors)进行干预,无需重新训练。通过 Contrastive Activation Addition(CAA)和基于优化的方法构建向量,可将不合理的自我偏好偏差降低最多 97%,显著优于提示词和 DPO 基线。
研究提出 Robustness Inheritance Benchmark(ImageNet-RIB),用于评估预训练模型微调后的鲁棒性保持情况。结果显示,在 LAION-2B 等最大最多样数据集上预训练的模型,在小数据集上微调后鲁棒性损失更大、绝对鲁棒性更低,这种崩溃出现在 CLIP 等对比预训练模型及其微调变体中,并随预训练规模增大而加剧,而所测试的监督模型未出现该现象。
研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。
研究对比 Laya、Jev 和 Qwen2.5-7B-Instruct 在候选集与任务变化下的拒绝策略迁移表现,发现源域校准常无法保持目标工作点:在 DBpedia 上校准的 Jev 策略会拒绝 69.3% 的 Emotion 测试输入,而 Emotion 策略则完全丧失检测能力。
研究者提出 JudgeProfile 框架,将 LLM 评判拆解为感知(对清晰度、正确性、细节等属性的比较)与优先级(各属性对最终选择的影响权重)两部分,并构建了含 50,013 对回答、覆盖 17 个公开数据源、21 个 LLM 评判者和 87 个属性的 SubjectiveSet 数据集。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。
TwinCheck 是一种推理时验证策略,仅在轨迹满足与局部失败假设绑定的证据条件时才考虑替换工具调用,并构造轨迹锚定的反事实"负孪生"方案,通过结构检查与双向成对验证器比较后才替换智能体的提议。
JEV-as-a-Judge 提出用只输出标签概率的决策型评判模型 JEV 做评估,由置信度决定直接采纳还是升级给推理型评判模型。在 16 个生成式与奖励模型评判器的对比中,JEV 在可直接从文本读出结论的场景下与 GPT-6 相差 3 分以内,费用仅为其 0.36%,中位延迟 0.15 秒,但在数学、代码和逻辑等需推导结论的场景落后。
WebRider 提出将网页任务委派形式化为"意图契约",记录目标、约束、证据义务、答案形式与任务级人格控制,并采用顶层控制器、中层受控可执行动作、工具层执行的分层架构。
研究者推出 SDR-Arena 框架与 SDR-Bench 语料库,用于大规模评测双方向生成式个性化,后者涵盖 22 个行业、3500 家企业的 5 万条客户成功案例。最佳模型 Claude Sonnet 4.6 仅达 55.8% WCS,表明只还原约一半制胜内容,且该瓶颈源于检索而非推理。与专业 SDR 的两项研究显示,仅 48% 生成话术无需编辑即可使用。
研究团队推出 OSGuard,一个用于评估计算机使用智能体安全性的双粒度基准套件,包含 324 个人工标注的动作级样本和 45 个基于 40 个 OSWorld 任务改造的风险增强执行任务。
研究者推出 SubtleMemory 基准,用于评测长时程 AI 智能体对细粒度关系记忆的辨别能力,包含 10 段长历史中的 1,522 个评测实例,基于 1,090 个关系受控的记忆变体集。
研究者提出 Universe of Thoughts(UoT)框架,将组合式、探索式与转化式创造力形式化为可执行的计算算子,并设计三个低约束创造性推理任务。T-UoT 搭配 GPT-4o 在 Bridge 和 Electricity 任务上表现最强,C-UoT 在 Society 任务上相对表现最佳。
在 KyGround 基准(198 道题,来自希腊 Kythera 农业平台记录,每题最多 9 种问法)上,以 Claude Haiku 4.5 作为路由与回答模型,向量 RAG 对标准希腊语问题正确率 95.3%,工具调用智能体仅 71.6%,相差 23.6 个百分点。
研究团队发布 MedConv 多语言数据集,包含英语、丹麦语和德语共 300 例临床问诊,并结合 ACI-BENCH 基准,将临床 AI 平台 Corti 与两款基于通用 AI 的 ambient scribe 软件进行对比。
研究提出"惩罚框架无有效选项 MCQA"设定,在 MMLU-Pro 数学子集上移除正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对无效强制选择进行惩罚。实验显示,即便有明确的无有效选项提示和惩罚评分,模型在原本答对的题目上仍会给出无效强制选择,说明高 MCQA 准确率并不能完全保证弃答可靠性。该工作已被 AACL-IJCNLP 2026 主会议短论文接收。
研究团队提出通过 Model Context Protocol(MCP)逐步下发流程步骤,让智能体每执行一步就返回结构化 step_output,以牺牲自主性换取过程可预测性。
研究者提出 ServeLearnBench,用于评估 LLM 智能体从服务经验中持续学习的能力,覆盖零售客服、银行和销售话术生成,包含 53 个环境窗口和 7,718 个任务。
研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器开发。
研究者发布 SEMAADB 数据集与基准,包含 3,000 个工程上下文和 15,000 张图,每个上下文含 Requirement、Block Definition、Activity、State Machine、Sequence 五个相互关联的 SysML 视图,其中 100 个上下文经人工核验构成测试集。
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。
研究者发布首个可端到端评估 Croissant 元数据提取的基准,含 602 篇论文,其中 102 篇有人工验证的 gold 标注、500 篇为 LLM 生成的 silver 标注,覆盖 Croissant 完整 schema 及 RAI 字段。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。
研究系统评估了 10 个推理模型在 LLM-as-a-Judge 中的设计选择影响,涵盖句子情感与毒性评分(每类超 500 条)及问答对二元准确率分类(n=600)两项任务。