NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口
NVIDIA Inception 计划中的多家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 FDA 获批 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 FDA 获批 WRDensity 已用于数十万患者,并研发可自动筛除阴性乳腺钼靶的新一代 AI。
NVIDIA Inception 计划中的多家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 FDA 获批 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 FDA 获批 WRDensity 已用于数十万患者,并研发可自动筛除阴性乳腺钼靶的新一代 AI。
研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。
研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。
研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。
研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。
针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。
SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。
研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。
研究者提出用扩散模型生成合成传感器数据窗口,对 CABiGRU 采用两阶段训练:先在合成数据上预训练,再在真实数据上微调。在 DEO(drinking/eating/other)数据集上,该流程取得 90.6% 的平衡准确率,优于强监督基线,缓解了少数类欠拟合问题。
OctLLM 提出用八叉树占用 token 构成的显式 3D 序列来表示几何,并通过随机清空倒数第二层节点、省略其后代得到更短的 S-Octree,用于位置感知的掩码建模生成与 3D 理解。
研究者提出 Sigma,首个大规模(3B/8B)连续扩散语言模型,基于可操控的低维 ODE/SDE 潜轨迹,按块通过似然优化训练,并利用自回归模型预训练权重热启动。
FiberGeoText(FGT)是一种视觉语言模型,可将超高分辨率扩散 MRI 重建的浅表白质(SWM)短程纤维束组织为群体级聚类,它联合表征每条纤维束的三维轨迹、皮层解剖上下文与形状,并用预训练 LLM 编码多种脑区划分方案生成的文本化皮层端点信息。
针对 LoRA 在持续学习中出现的"谱可塑性崩溃"问题,研究者提出 MuLoRA,通过历史白化与动量更新的近似极正交化,联合控制低秩空间的容量分配与利用。在五个类增量基准、八种增量设置共 16 项指标中,MuLoRA 在其中 15 项取得最高平均准确率。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
研究用 Mixture-of-Agents(MoA)方法测量单个 token 实际所需的计算量:由 Qwen、OLMo、R1-distilled 三个模型族共十五个不同规模模型逐 token 复现参考序列,以最小成功模型的推理成本作为该 token 的充分算力。
EviDent-CBCT 提出一种证据瓶颈式框架,用于在报告监督不完整的情况下从牙科 CBCT 生成报告:解剖感知网络将每次扫描映射为离散的牙级、全局及 tooth-IAC 证据记录,再由牙科逻辑一致性投影与确定性渲染器配合图像盲本地语言模型生成报告。
HyMLRaman 混合框架结合深度光谱特征提取、生成模型与经典机器学习分类器,可识别阿莫西林、氯霉素、环丙沙星、四环素、布洛芬、对乙酰氨基酚六种药物化合物。
研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。
SDECast 是一个基于 Neural SDE 的连续时间概率天气预报框架,通过扩展 SDE Matching 直接在物理空间学习随机动力学,训练时无需反复进行 SDE 模拟。
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
DeepStratNet 将地震层位追踪从稠密语义分割改为有界坐标回归,模型直接预测每个横向位置处目标层位的时间/深度坐标。该框架由兼容任意预训练视觉骨干的轻量回归头与 LSTM 模块组成,用于建模切片间上下文并生成连续层位面,训练采用 L1 与 L2 损失并结合地质先验正则约束相邻道连续性。
一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。
研究提出 gamma-CUBV 统一框架,用累积量包络 gamma(lambda) 控制泛化差距的矩生成函数,将 Hoeffding、Bernstein、依赖感知、PAC-Bayesian 与异构源融合等风险界纳入同一体系。
研究评估了 21 个自然可见图(NVG)拓扑指标,用 SHAP、分组 Permutation Importance、Boruta 和 RFE 四种方法经 Consensus Ranking 整合,在 CICIDS2018 数据集与 CNN 分类器上测试。
针对流匹配模型统计泛化保证不足的问题,研究者推导出学习生成分布的有限样本误差界,以 Wasserstein-p 距离度量(p≥1)。在 n 个 i.i.d. 样本下,当维度 d 超过目标测度的 Wasserstein-p 维度时,学习分布以至少 1-ξ 的概率满足误差上界 n^{-1/d}+n^{-1/(2p)}(log(1/ξ))^{1/(2p)}。
TerrainForge 能从重建的多车驾驶片段中生成以道路几何为核心的反事实场景,其统一道路模型将场景形变与四轮车辆动力学相连,使坡顶、坡谷、减速带和摩擦变化传导至车辆运动、相机视角与车间距。
多模态基准 TasteBench 发布,用于可持续蛋白的感官预测,包含基于 215 种植物基食品、21K+ 人类评估构建的食品级排序任务(935 个同类别排序对)和覆盖 15K 风味分子的分子级味觉分类任务。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究系统考察了深度序列模型在时间序列共形预测中的三种用法:条件分位数回归、条件分位数函数估计与局部化共形预测。作者给出理论分析,证明这三种方法在适当假设下均具备渐近条件覆盖率保证,并在真实数据集上验证了其有效性。
研究提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。
研究融合美国 SEC 财务数据与 EPA 设施级温室气体登记数据,用梯度提升架构和 Mondrian Conformal Prediction 构建企业实际排放的算法基线,并据此提出 Conformal-Weighted Continuous Divergence(CWCD)指标,量化企业自报排放与算法基线之间的差距。
研究提出用 O'PRIOR 合成任务生成器构建可验证的归因测试台,每个预训练任务都带有结构机制、缺失、混杂、捷径和分布偏移的显式来源标注。在留出真实任务上,移除归因排名前 5% 的合成任务使平均 ROC-AUC 下降 0.013,随机移除仅下降 0.002±0.004,移除末位任务则提升 0.003。
研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。
研究者提出特征追踪型物理信息神经网络 FT-PINN,将解网络定义在固定参考域上并与参数化非线性流形上的微分同胚变形映射复合,通过联合训练使配点自动聚集在激波等特征附近。在含合并激波的 Burgers 方程、Euler 激波管和二维正则激波反射四个测试问题上,FT-PINN 在有限配点预算下准确定位激波,而相同架构与预算的普通 PINN 则定位错误或无法形成激波。
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。
Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。
TRACE 是一个可复现的电价预测基准,包含美国某主要市场五个区域的 7,300 个区域-日实例,将电价与预测截止时点可获取的官方运营文本配对,并在每个截止点重建文本以避免信息泄漏。在时序基础模型上,TRACE 使上尾 pinball loss 中位数降低 7.4%;跨日文本错配消融实验则使增益反转,低于无文本基线。