OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开难题中的 90 个
OpenAI 从一个未公开的内部前沿模型发布 722 篇数学手稿,归入 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力。
推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可了解其规模、算力成本与学界对结果可靠性的分歧。
OpenAI 从一个未公开的内部前沿模型发布 722 篇数学手稿,归入 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力。
推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可了解其规模、算力成本与学界对结果可靠性的分歧。
SEGUE 是一个让流式视频生成器忠实执行中流提示词切换过渡的新框架:每次切换时由免训练规划器解析最新帧与提示词,写入带角色和时长的 segue prompts 后再交还用户提示词。
研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。
针对长视频中物体反复消失与重现的开放世界分割难题,研究者提出零样本、半在线、类别无关的 Savvy 系统与 OGA 评测套件。Savvy 结合模块化掩码发现、基于累积证据的延迟准入与轨迹整合来维护动态物体集合;OGA 支持多预测对应单一参考并保留预测 ID。
研究团队推出诊断基准 SalArt-VQA,包含 950 张图像和 3,681 道人工编写多选题,用于评估 VLM 对 AI 生成图像中显著伪影的细粒度理解。在 20 个 VLM 上测试发现,最强模型伪影检测召回率达 99.37%,但四类伪影问题全部答对的图像仅占 53.26%。该基准已入选 NeurIPS 2026 E&D Track(Oral)。
研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。
开源工具 PlotPick 利用视觉语言模型(VLM)从批量科学图表中提取表格数据,并在 ChartX 和 PlotQA 上对来自四家提供商的九款 VLM 与专用图表转表模型 DePlot 进行基准测试。
研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。
研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。
RenderBench 是一个面向渲染到真实(render-to-real)视频迁移的基准,包含 12 个重建的真实场景,覆盖大规模室内环境与第一人称视角,含静态和动态设置。
视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。
研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。
研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。
研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。
研究将 TypeSafe 宣传的 "System One" 模型 JEV 与 GPT-6 Luna、Qwen3.8-27B 及已发表研究中的人类编码员在七项政治学复现任务上对比,发现 JEV 准确率与两款 LLM 相当或接近。
研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。
一项被 SLT 2026 接收的研究构建了统一生成式评测套件,在匹配数据分布与生成设置下对比纯语音、纯文本和语音-文本语言模型。结果显示联合语音-文本建模显著提升语义连贯性,但音素级指标变化有限,说话人相似度与预测质量反而更低,情感分布指标则有所改善。相比更大规模的纯语音模型,该语音-文本模型在基于转写的语义连贯性上缩小了大部分规模差距。
研究者发布德语开放问答临床基准 MedQADE,含 3,800 组问答、10 位医生标注和 9 个 LLM 评审。医生对答案正确性一致性中等偏强(Cohen's kappa = 0.612),Gemini 3 Flash 接近留一医生参考(kappa = 0.694 vs 0.709)。
研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。
研究者提出双向基准 GapEval,用于量化统一多模态模型(UMM)理解与生成能力之间的差距,每道题均可用图像和文本两种模态作答,实现双向推理与跨模态一致性的对称评估。实验显示,不同架构的 UMM 在两个方向上普遍存在持续差距,表明当前模型仅实现表层统一,而非深层认知融合。从知识操作角度的实证研究进一步发现,UMM 内部知识往往彼此割裂,跨模态的能力涌现与知识并不同步。
研究发现 EmoNet-Face-HQ 细粒度情绪识别基准的失败源于答案读取方式而非模型感知能力:改用 logits 逐类二分类读取后,11 个开源 VLM 全部超过专家一致性锚点(κ_w=0.507-0.586),其中 3 个显著优于微调模型 EIF(Small κ_w=0.551,Large κ_w=0.534)。
研究者提出 DyaFDB,一个在二元设定下评估全双工语音对话模型的框架:两个模型按指定角色直接对话,目标可合作或冲突,双方均由外部裁判离线打分。该框架实例化 4 项任务、140 个场景,记录 7,560 段对话,覆盖 6 种自博弈与交叉配对。实验显示模型行为会持续重塑其对话伙伴,因此每个模型必须同时充当对方的考官与被试,固定 interlocutor 无法胜任。
VoxReason 提出一个 100 案例的验证器基准,固定每句话、只改动一个指定来源标签线索,并评估引用证据、八个计划字段和允许的响应。在 24 案例的来源键不相交测试中,来源情绪先验的计划槽准确率达 0.958,但 24 个编辑后的中性目标均未出现在其训练标签中,必需变更准确率为 0.000。在 32 案例的情绪不相交测试中,该先验的计划槽准确率为 0.219,必需变更准确率为 1.000。
针对大语言模型偏见评估中单对对比句不可靠的问题,研究者提出双最小对(dual minimal pair)评估框架,通过改写与替换属性生成英文、俄语、西班牙语和中文的刻板印象数据,并设计两项评估指标,其中一项基于社会群体与刻板属性间互信息(MI)的新指标更适合跨语言、跨模型聚合比较。代码已开源。
研究指出,复用挑选 Best-of-N 获胜者的分数会高估其期望奖励。基于每个候选 K 个独立分数的固定矩阵,仅当 J<K 时,单一估计量才能对期望评判奖励完全无偏;在 J=K-1 时,无偏 minimax 风险为 σ²/√K 量级,允许偏差则可提升至 σ²/K。对两个候选者,Holdout 无需已知方差即可达到 1/(π√2) 的渐近无偏 minimax 常数。
研究用同数字引用替换法压力测试 Jev 作为金融证据评判器的表现,评估其对 GPT-4.1-mini 计算轨迹的来源支撑验证能力。在固定操作数与运算、仅在同数字单元格间移动引用的条件下,带符号数字指针基线解释了大部分恢复效果,显式列标签能改善部分错误角色判定,但也会降低对等价证据的支持。在 36 个新来源页上的后续评测复现了检测角色错误与保留有效引用之间的同一权衡。
一篇立场论文提出"翻译同构假设"(TIA)在原则上就不成立,即部分概念(如语用标记、敬语、历时分层词汇)的语义结构无法跨语言无损映射。作者用 usage-cloud 框架将概念表示为上下文化嵌入的点集,定义 α-unalignability 为无法同时保持词汇忠实(质心对应)与结构忠实(局部邻域拓扑)。
研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。
研究者提出 OMIT 基准,包含 218 个配对框架场景、覆盖 10 种冲突类型,场景由基于 LLM 的五视角哲学人格面板(功利主义、义务论、美德伦理、关怀伦理与契约主义)的分歧模式构建。
研究者推出 SteerScope,一个双轴多维评估套件,通过 15 项指标联合刻画 LLM 引导效果与方法属性,并在匹配模型、任务和评估协议下基准测试了涵盖 4 个家族的 23 种方法,包括 prompting、LoRA 和 SFT 基线。
研究者推出 HouseholdBench,整合 6 项美国家庭调查与 32 个预测任务,覆盖消费、收入、劳动、预期和住房等数值、分类及概率结果,用于测试 LLM 能否预测家庭行为及其对政策变化的调整。13 个闭源与开源权重 LLM 参与评测,最佳模型将数值结果误差降低 12.2%,多数任务中梯度提升树排名第一。通过微调并聚合 16 次预测,40 亿参数开源模型可达到闭源模型水平。
研究提出"洞见溯源"(Insight Provenance)任务,判断审稿洞见来自人类、LLM 还是二者混合,并基于 4,057 篇论文和 12,660 条人类审稿构建 InsightProv-v0,用 GPT-4o、Gemini 和 DeepSeek 模拟不同 LLM 参与程度并做句级标注。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
JudgeMoE 是一种轻量聚合器,对缓存的 judge 分数分布分配样本级权重并在计算最终分数前融合。在原始 10-cell 基准上,其平均 Spearman 相比 uniform log pooling 提升 +0.079;在 16 个 cell 上相比最强单一 judge 平均提升 +0.0393,12/16 个 cell 为正,单侧 Wilcoxon 符号秩检验 p=0.0091。
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
研究在 IndicMT Eval 上把目标译文重新编码为拉丁字母后发现,文字系统身份可解释原生文字 COMET 分数方差的 22.9%,且五种语言与人工标注的一致性全部下降,问题根源在 tokeniser。
一项 arXiv 预印研究用小型开源权重 LLM 读取双人咨询转录文本,跨域迁移预测专家整体印象,留一域迁移的嵌套 Spearman ρ 达 0.54,高于目标域内训练的 ≤0.48,配对差距 +0.15,训练集规模匹配后仍为 +0.12。
研究者提出 Pairwise Faithfulness Benchmark(PFaithBench),评估模型能否在支持性与非支持性上下文下对同一问题切换回答与弃答。
GaugeBench 通过改写固定机械结构的物理等价约定(如关节轴方向、关节角零点和连杆命名顺序)来评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅剩 51.6,低于 98 个真正未见机器人的 1489.6。