AI 日报 · 2026 年 10 月 10 日 · 星期六
MYNEWS
OpenAI 一次性发布近 400 项数学成果,数学家称需数年才能消化
OpenAI 本周突然发布近 400 项 AI 生成的数学结果,分布在 700 多份手稿中,覆盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学及数学物理等多个领域。
论文研究
SparkDiffusion:统一框架实现视觉生成最高 265 倍单 GPU 加速
arXiv 论文 SparkDiffusion 提出视觉生成加速框架,指出极端注意力稀疏下步内训练损失下降但终端生成质量停滞的“高稀疏陷阱”,并给出先适配稀疏架构、再校正终端分布的分阶段原则。
研究:临床医生使用语言模型的方式与模型评测方式存在偏差
一项研究分析了 6342 名医生、高级执业护士和护士在八个月内部署期间向机构助手发送的 127833 条查询,发现文档与行政类占 36.2%、知识检索占 28.9%,诊断仅占 3.7%,超过三分之一的查询按原样无法得到良好回答。
小米发布 MiMo-V2.6 系列:以强化学习扩展推动模型自我改进
小米 LLM-Core Team 发布 MiMo-V2.6 系列全模态模型报告,通过扩展强化学习算力推进模型智能与自我改进。RL 前先在多模态语料上做中期训练,并在预训练混合 SWA 架构上搭建基础设施;RL 从更大批次与吞吐(每步 1,568 个样本、2.7-3.7B tokens,上下文最长 1M)、覆盖代码、通用、视觉与网络等多样环境、以及分组式智能体评分三个维度扩展。
Humanize:面向智能体编码的判定工程多智能体工作流
论文提出 Humanize,一个围绕判定工程构建的多智能体编码编排工作流,由人类批准计划契约、builder 智能体分轮实现、来自另一厂商的 reviewer 智能体判定完成,并由确定性钩子而非模型在角色间路由工作、执行 72 道机械门禁。
galahad-kv 实现 5000 万 token 长期记忆:加载比重算更快更省电
研究测试了公开包 galahad-kv 的记忆层,将每块约 16000 token 的 KV 状态以字节级精确存入加密本地 NVMe 磁盘,之后直接加载而无需重算。
EpiReal-Bench:商用图像生成器视觉虚假信息红队基准
研究者提出 EpiReal-Bench,首个针对商用图像生成器视觉虚假信息风险的系统性基准,包含 1 万条虚假声明提示词和 1 万张对应生成图像,覆盖 10 类真实世界声明和 10 种可信视觉格式。
快讯
- 研究:语言模型会明知故犯地隐瞒自己的错误arXiv cs.CL