OpenAI 在 GitHub 发布 372 条 AI 生成的数学证明
OpenAI 在 GitHub 上发布了由内部前沿模型生成的 372 条数学结果,每条都声称解决了一个开放问题或取得实质进展,其中包含对主要计算机算法的改进以及与黎曼假设相关的推进。
推荐理由:OpenAI 把 372 条 AI 生成的数学结果直接发到 GitHub,读者可借此看到学术评审流程与 AI 产出速度之间的张力。
OpenAI 在 GitHub 上发布了由内部前沿模型生成的 372 条数学结果,每条都声称解决了一个开放问题或取得实质进展,其中包含对主要计算机算法的改进以及与黎曼假设相关的推进。
推荐理由:OpenAI 把 372 条 AI 生成的数学结果直接发到 GitHub,读者可借此看到学术评审流程与 AI 产出速度之间的张力。
OpenAI 从一个未公开的内部前沿模型发布 722 篇数学手稿,归入 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力。
推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可了解其规模、算力成本与学界对结果可靠性的分歧。
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
SymNetPro 在 SymNet 的双任务无线电地图重建与定位骨干上新增两个组件:稀疏 LOS 感知注意力偏置和发射机丢弃增强,用于从稀疏接收功率观测中定位多个定向发射机。在定向射线追踪城市环境实验中,其 OSPA 在极端稀疏采样下显著低于代表性定位基线,并在测量噪声和发射机数量增加时保持稳定增益。代码、数据集和模型检查点已公开。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上进行持续预训练。
研究者提出 VT-MUSE,一个面向视触觉操作任务的多模态统一序列表征学习框架,通过两阶段学习解决视觉与触觉独立编码及忽略接触时序演化的问题。在仿真基准上,VT-MUSE 在所有任务上超越最强基线 11 个百分点,真实世界实验也取得显著提升。
DexPIE 是一个从真实部署经验中提升灵巧操作策略的后训练框架,通过适配灵巧手干预系统和多阶段 DAgger 式数据采集实现有效探索覆盖。在三个真实世界灵巧操作任务上,DexPIE 相比基于演示的参考策略成功率提升 37.3%,优于所有基线方法。源代码和数据集将公开。
HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。
ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。
研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。
LoDEOT 用五维偏移 token 替代高维实例 token 来预测屋顶到轮廓偏移(RFO),在保留高维实例 token 做检测与分割的同时,将实例 token、浓度门控屋顶和框掩码证据映射为五维偏移 token,再经独立二维读出。在 BONAI 数据集上,其 FAP50 达 54.58、mEPE 为 5.23 像素,FAP50 比所评估的端到端基线高出 7.56-16.85 个百分点。
SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。
研究提出 SCAI SCI Gait 数据集,包含 239 名脊髓损伤成人的同步视频、动作捕捉与测力台数据,通过单目矢状面视频拟合参数化人体网格并驱动 OpenSim 模型。
CNP-Flow 是一个通过流反转学习条件源分布的时间生成流匹配框架,用条件噪声预测器(CNP)为每个时间条件生成各向同性高斯源,替代标准条件流匹配从标准高斯采样的做法。
VolS-GS 是一个可重光照的 Gaussian Splatting 框架,通过将高斯场景的空间支撑作为可微有限体积传输求解器的域,让光线在物体内部传播,从而建模次表面散射等非局部效应。该框架用小型网络为每个 Gaussian 预测散射与吸收系数,并在三个 OLAT 基准上持续提升新光照与新视角下的重光照质量。
DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。
一篇综述从场景表示、时序建模、重建流程与优化目标四个维度统一梳理 4D 场景重建方法,涵盖 NeRF 与 3D Gaussian Splatting 等路线。该框架分析了不同设计选择对几何保真度、外观一致性、运动表示与计算效率的影响,并整理了常用数据集与评测指标,指出当前实验实践的局限与开放挑战。相关论文与资源集合持续更新。
TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。
研究者提出 MeshOctave,通过二进空间网格分辨率定义尺度,将网格粗化视为体素单元内顶点合并的确定性坍缩,并用 split-and-rewire 逆操作逐面确定八分体子顶点与局部连接,无需序列化即可并行生成。该方法采用尺度条件掩码均匀离散扩散模型学习该操作,在几何保真度与拓扑有效性上大幅超越强基线,并支持自适应分辨率细化与网格细分任务。
SEGUE 是一个让流式视频生成器忠实执行中流提示词切换过渡的新框架:每次切换时由免训练规划器解析最新帧与提示词,写入带角色和时长的 segue prompts 后再交还用户提示词。
研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。
研究者提出 Residual Patch Adapter(RPA),一种轻量模块化适配器,利用 ViT 视觉编码器中间层的全部 patch token 进行对齐,在 THINGS-EEG2 上取得被试内 95.4%、跨被试 35.5% 的 Top-1 准确率,在 THINGS-MEG 上分别为 65.2% 和 6.7%,两个数据集均达 SOTA。
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。
研究用 CHASE DB1 全部 28 张图像和两位人类标注,考察视网膜血管分割中阈值选择对评估结果的影响。固定七折协议保持 14 名受试者双眼同折,随机森林与 Extra Trees 对观察者 1 拟合三个随机种子共 42 次。
针对重建 FID(rFID)与生成 FID(gFID)相关性弱甚至为负的问题,研究者提出生成感知重建(GAR),通过向编码器 latent 加噪并经生成模型去噪,构建从重建到生成的连续轨迹。基于该轨迹的诊断指标 GAR-FID 在多种 tokenizer 和规模下与 gFID 强相关,且中间 GAR latent 保留与源图像的配对监督,可用于解码器适配,在不同模型规模上持续提升生成质量。
PointZero 提出以 3D 点轨迹补全作为预训练目标,无需机器人动作标签即可学习可迁移的 3D 动态先验。研究团队构建了包含 290 万合成帧、覆盖可变形、铰接与刚性物体的数据集,并训练出基于 Transformer 的 PointZero,在相同数据上优于此前方法。
RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。
Tree-VQ 将预训练扁平 VQ 分词器事后转换为支持任意前缀的渐进式表示,保留原有编码器分配和全部学习到的叶向量。该方法把码本组织为平衡二叉层级,按深度优先顺序传输分支决策,使每个额外分支比特精确细化一个 token,传输可在几乎任意载荷位置截断。
研究者提出局部认知不确定性引导主动采样框架 LEADer,用于扩散模型图像修复(DMIR)。该方法在空间域用逐像素不确定性动态调节零空间先验强度,在时间域用不确定性轨迹量化采样稳定性以实现自适应轨迹剪枝,理论证明其满足严格数据一致性且剪枝策略具有确定性误差界。LEADer 可即插即用地集成到多种 DMIR 基线,在提升多个 SOTA 方法性能的同时显著减少采样时间,内存开销可忽略,代码已开源。
研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。
一项研究在 YOLO-World 框架上提出多模态目标检测模型,用基于注意力的 A2C2f 层替换 YOLOv8 主干中的 C2f 层,以更精确表征小目标局部特征。在 VisDrone 数据集上,该模型精度从 43.0% 提升至 45.1%,召回率从 32.8% 升至 35.0%,mAP@0.5 从 32.5% 提高到 35.2%,mAP@0.5-0.95 从 18.5% 升至 19.9%。
UniPose9D 是一个类别无关的 9D 物体位姿估计统一模型,仅凭实例 mask/ROI 加 RGB-D 或带预测深度的 RGB 图像,即可在无类别标签、CAD 模型、平均形状先验和参考视图的情况下估计旋转、平移与度量尺寸。
研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。
针对长视频中物体反复消失与重现的开放世界分割难题,研究者提出零样本、半在线、类别无关的 Savvy 系统与 OGA 评测套件。Savvy 结合模块化掩码发现、基于累积证据的延迟准入与轨迹整合来维护动态物体集合;OGA 支持多预测对应单一参考并保留预测 ID。
研究者提出新任务 RefGC-SR²,在生成后处理阶段复用用户提供的原始高分辨率参考图,同时恢复丢失细节、修正生成伪影并放大输出。为此构建了首个真实场景三元组数据生成流程,并训练出双联图条件生成器来合成配对低质锚点。所提出的频率感知扩散 Transformer 模型能选择性注入参考图细节并去除伪影,在身份保真与高分辨率细节恢复上均优于现有 RefGCR 和 RefSR 基线。
研究团队推出诊断基准 SalArt-VQA,包含 950 张图像和 3,681 道人工编写多选题,用于评估 VLM 对 AI 生成图像中显著伪影的细粒度理解。在 20 个 VLM 上测试发现,最强模型伪影检测召回率达 99.37%,但四类伪影问题全部答对的图像仅占 53.26%。该基准已入选 NeurIPS 2026 E&D Track(Oral)。
研究者发布 DB-3DME,一个包含 2,619 个合成 3D 网格及 Geometry 与 Prompt Adherence 人工评分的数据集与基准,用于 3D 网格评测。
研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。
一项 arXiv 研究显示,基于扩散 Transformer 的文本到图像模型通常只依赖文本表示中两个简单方面:相邻 token 合并为词表示,以及由文本编码器位置嵌入刻画的词序。研究者构造了仅编码单词含义与顺序、不含完整提示词上下文信息的"位置标记词袋"嵌入,发现其引导生成的视觉质量与文本保真度与完整文本嵌入相当,说明复杂语言结构的解码实际由图像模型自身完成。