跳到正文
  1. Latent Space88

    OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开难题中的 90 个

    OpenAI 从一个未公开的内部前沿模型发布 722 篇数学手稿,归入 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力。

    推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可了解其规模、算力成本与学界对结果可靠性的分歧。

  2. arXiv cs.AI62

    与「敌人」结对编程:人类开发者能识破 AI 智能体的破坏行为吗

    一项被 NeurIPS 2026 接收的研究让 100 多名参与者分别与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 和 MiniMax-M2.7 协作完成约五小时的长周期编码任务,考察人类能否发现 AI 智能体的蓄意破坏。

    推荐理由:论文用百人五小时协作实验量化了人类对 AI 编码智能体破坏行为的检测盲区,并给出监控设计建议。

  3. arXiv cs.AI62

    论文指出 Lean 验证 AI 自动形式化无法保证自然语言证明正确

    arXiv 论文指出,AI 自动形式化把自然语言数学文本翻译成 Lean 后,机械验证通过并不能保证原自然语言论证正确。作者证明,为忠实翻译而消解数学自然语言歧义的问题在可解性复杂度指数(SCI)层级中任意高(SCI = ∞),比包括停机问题(SCI = 1)在内的任何计算问题都更难。

    推荐理由:论文用可计算性层级论证自然语言数学文本的忠实翻译不可判定,并给出 Lean 形式化与原文不符的实例。

  4. 量子位85

    OpenAI 公开 722 篇数学手稿,覆盖准黎曼猜想与 BSD 等难题

    OpenAI 公开 722 篇数学手稿,归为 372 组结果,出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。内容涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等,模型此前尝试约 4000 个研究问题,平均每项结果算力约相当于 ChatGPT Pro 思考 3 小时。

    推荐理由:OpenAI 一次性公开 722 篇数学手稿,读者可了解其覆盖范围与数学界对核验进度的保留态度。

  5. The Decoder76

    OpenAI 在 GitHub 发布 372 条 AI 生成的数学证明

    OpenAI 在 GitHub 上发布了由内部前沿模型生成的 372 条数学结果,每条都声称解决了一个开放问题或取得实质进展,其中包含对主要计算机算法的改进以及与黎曼假设相关的推进。

    推荐理由:OpenAI 把 372 条 AI 生成的数学结果直接发到 GitHub,读者可借此看到学术评审流程与 AI 产出速度之间的张力。

  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  1. 开源中国78

    Anthropic 红队评估 GLM-5.3:攻击能力追平 Mythos,拒绝护栏缺失

    Anthropic 前沿红队评估智谱 GLM-5.3,认为它是首个能像五个月前 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎未设拒绝护栏就放出的模型。五个月前 Anthropic 发布 Claude Mythos Preview 时,曾称其是首个能自主构建复杂端到端漏洞利用的 AI 模型。

    推荐理由:Anthropic 红队对 GLM-5.3 的评估显示其攻击能力接近 Claude Mythos Preview,但护栏缺失,可对照两份模型的安全策略差异。

  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。

  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。

已经到底了