跳到正文
今天10月7日周三563 条
  1. The Decoder76

    OpenAI 在 GitHub 发布 372 条 AI 生成的数学证明

    OpenAI 在 GitHub 上发布了由内部前沿模型生成的 372 条数学结果,每条都声称解决了一个开放问题或取得实质进展,其中包含对主要计算机算法的改进以及与黎曼假设相关的推进。

    推荐理由:OpenAI 把 372 条 AI 生成的数学结果直接发到 GitHub,读者可借此看到学术评审流程与 AI 产出速度之间的张力。

  2. 开源中国26

    SonnetDB 4.0.0 发布:完善 SQL 与多模型协作,强化部署和恢复边界

    开源多模型数据引擎 SonnetDB 4.0.0 已在 GitHub 发布,基于 C# / .NET 10 构建,采用 MIT 许可证,支持嵌入式运行和独立 Server 部署。本次更新完善了 SQL 与关系数据能力,扩展 CTE 等功能,并强化了部署与恢复边界。该引擎以数据库目录为持久化边界,为时序、关系表、KV、JSON 文档、全文、向量、对象、消息队列和 Graph 提供各自原生语义。

  3. 掘金22

    从"算子"到"AI Infra":大模型背后看不见的那群人在忙什么

    大模型运行依赖算子与 AI Infra 两层支撑:算子是最基本的计算步骤,如 MatMul、ReLU、Softmax,同一算子优化前后速度可差几十倍,FlashAttention 通过重排计算顺序让注意力计算快了好几倍。AI Infra 则覆盖从芯片到上线服务的整套系统,解决跑得起、跑得快、跑得省的问题,常用指标 MFU 能做到一半左右已算不错。

  4. 掘金77

    DeepSeek 据报接近完成至少 800 亿元融资,腾讯与宁德时代领投

    据 Bloomberg 援引知情人士报道,DeepSeek 接近完成至少 800 亿元(约 120 亿美元)融资,高于原定约 500 亿元的目标,由腾讯与宁德时代领投,最终金额可能逼近 1000 亿元。资金将用于扩大算力基础设施、加速模型研发与团队建设,公司计划 2027 年初启动科创板 IPO,中信证券已担任上市辅导机构。DeepSeek 方面未公开确认,融资细节仍可能在最后谈判中调整。

    同一新闻,精选展示《宁德时代与腾讯领投 DeepSeek 融资,公司计划 2027 年 IPO》

  5. 掘金20

    即时通讯系统的关键设计:消息同步、定序与投递可靠性

    即时通讯的核心是让不可靠、可离线的多端与服务端就"发生了哪些事、以什么顺序"达成一致,集合与序需分别保证。消息经幂等键去重、分配 seq 定序后落库投递,ACK 仅表示已受理,服务端回显才确认发送成功。同步侧通过会话链与收件箱游标实现跨会话增量拉取,写扩散适合单聊小群,读扩散适合超大群与聊天室。

  6. arXiv cs.CV22

    HRDexDB:跨人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。

  7. arXiv cs.CV24

    MT-cGAN:无需高分辨率形态学图像即可自动分割全膝关节软骨与半月板并可靠量化 T1ρ 和 T2

    研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。

  8. arXiv cs.CV27

    基于运动的 AI 生成视频检测器存在数据集偏差与捷径学习

    研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。

  9. arXiv cs.CV18

    基于标注保留扩散增强的夜间行人检测:Contrastive-SDXL 缓解光照域偏移

    Contrastive-SDXL 是一个基于 SDXL-Turbo 并用 LoRA 微调的日转夜增强框架,用于夜间行人检测。它引入由 DINOv2 编码器引导的 patch-wise 语义对比损失和物体一致性损失,生成图像的 FID 为 22.5。用其合成图像训练的检测器相比仅用白天数据的基线漏检率降低 6-7%,接近真实夜间数据训练的效果。

  10. arXiv cs.CV13

    面向噪声参与度识别的机器遗忘:按主体移除有害数据

    研究将主体级机器遗忘用作参与度识别的后处理净化机制:在已训练模型上排序有害主体并做轻量近似遗忘更新,无需完整重训。在 DAiSEE 和 EngageNet 上以 TCCT-Net 为固定平台,K=3 遗忘集设置下分别恢复 oracle 增益的 92.5% 和 89.3%,成本约为重训的四分之一。效果在中等遗忘集规模时最强,依赖主体选择质量与移除机制。

  11. arXiv cs.CV22

    面向 3D Gaussian Splatting 的场景无关物体中心表示学习

    研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。

  12. arXiv cs.CV18

    AdaRAG-CT:自适应检索增强的 3D CT 报告生成框架

    针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。

  13. arXiv cs.CV27

    Cultural Counterfactuals:用反事实样本评估大型视觉语言模型的文化偏见

    研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。

  14. arXiv cs.CV24

    MedVAR:面向多解剖区域医学图像生成的可扩展下一尺度自回归模型

    MedVAR 是首个通过自回归训练实现全方位医学图像生成的基础模型,在 40 个数据集共 438,905 张切片上训练,覆盖 CT 和 MRI 的六个解剖区域,生成速度比 100 步扩散基线快 12-19 倍。生成质量随模型规模提升,用其生成图像预训练可将七中心肝细胞癌分割 Dice 从 0.615 提升至 0.632。

  15. arXiv cs.CV33

    深度伪造检测的缩放定律研究:ScaleDF 数据集与幂律规律

    研究系统分析了深度伪造检测中的缩放定律,发现检测平均误差随真实图像域数量或伪造生成方法数量增加呈可预测的幂律衰减,类似大语言模型的缩放规律。为此构建了 ScaleDF 数据集,包含来自 51 个数据集的超 580 万张真实图像和 102 种方法生成的超 880 万张伪造图像。该规律可用于预测达到目标性能所需的额外域或方法数量,并以数据为中心应对不断演进的深度伪造技术。

  16. arXiv cs.CV22

    用引导扩散模型分析 DNN 特征空间

    研究者提出一种引导扩散模型解码器,可生成特征与用户指定特征高度匹配的图像,从而精确分析视觉 DNN 的特征空间。该方法无需训练即可分析不同 DNN,且可在单块商用 GPU 上运行,在 CLIP 图像编码器和 ResNet-50 上的实验验证了其有效性。代码与数据已公开。

  17. arXiv cs.CV24

    UltraDiff:面向超声形状优化的可微光线追踪框架

    UltraDiff 将可微渲染范式扩展到医学超声,把超声成像建模为以飞行时间门控的路径空间积分,并推导出前向模型及场景参数梯度的 Monte Carlo 估计器。该框架基于 Mitsuba 3 实现,在逆几何估计任务中从球体出发优化 SDF,可从模拟 B 超扫查和真实脊柱体模机器人采集中恢复椎体表面,无需预分割图像即可在 B 超图像上无监督完成,几何精度与当前最优方法相当。

  18. arXiv cs.CV30

    ROMA:面向真实世界物体中心多感官主动感知的 LLM 系统

    ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。

  19. arXiv cs.CV29

    从单张图像构建罗马:Trellis 2 改造实现室内外场景 3D 重建

    研究者提出一种方法,将 Trellis 2 等以物体为中心的 3D 生成器改造为可处理室内外场景的单图 3D 重建。方法通过按相机距离自适应分块、建立显式 2D-3D 对应关系,并合成约 4,000 个室外场景扩充训练数据。在 Tanks and Temples、ScanNet++ 及真实图像上,该方法在几何精度和感知质量上均优于所有基线。

  20. arXiv cs.CV26

    ALIVE:面向首帧引导视频编辑的交互对齐物体插入框架

    ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。

  21. arXiv cs.CV22

    基于 Patch 的高光谱图像分类中的数据泄漏:量化空间重叠的影响

    研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。