基于基础模型引导扩散的 LiDAR 分辨率恢复
研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。
研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。
HuC-VideoMAE 提出一种人体中心掩码方案,利用身体关键点和人体边界框区域,在合成人体运动数据集上自监督预训练视频 Transformer。
研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。
研究者提出 ConnectomeX 与 FlyVision,一种保留 ON/OFF 并行处理、循环计算和群体图交互的可训练架构。
研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。
针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。
PolarScale 是一个将辐射尺度作为显式预测与评估目标的 RGB-to-Stokes 基准,基于现有三色全 Stokes 测量,要求模型预测归一化 Stokes 分量、AoLP/DoLP/DoCP 及每场景尺度。
数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。
一项持续学习研究在 YOLOMG(基于 YOLOv5 的热红外检测器)上顺序训练 Anti-UAV-RGBT、Anti-UAV410 和 CST Anti-UAV 三个反无人机基准,朴素微调在 CST 上对第一阶段上限的遗忘度量 FM 为 -0.605,相当于 90% 能力损失。
一项多模型审计在儿童数据集上测试了 EmoNet、EmotiEffLib、DDAMFN++、OpenFace 3.0、LibreFace 五个 AffectNet 预训练表情模型,发现儿童性能下降与架构无关,且集中在张嘴(被误读为 surprise,与 AU26 下巴张开相关)和南亚裔儿童上。
MacJEPA 是一种缺失模态鲁棒的音视频识别模型,将第一视角模态缺失重新定义为未剪辑多事件视频中时间局部的传感器中断,并通过窗口级模态 dropout 模拟训练。
研究团队提出一种基于 Transformer 的重建框架,将冻结及参数高效微调的 CLIP、BiomedCLIP、DINOv2 视觉编码器用作心脏 MRI 加速重建的先验。
研究团队构建了 SkinLex,一个整合 SkinCon、DermaCon-IN、MM-Skin 和 PASSION 四个公开数据集、涵盖 48 种临床形态学属性、共 20,411 条记录的统一数据集。
PhysTacGen 是一个视觉到光学触觉图像生成框架,通过融合材料感知描述与几何条件来合成触觉图像。
EmbodiedSmith 是一个通过递归自我改进(RSI)实现可扩展具身数据生成的框架,将资产、场景与任务生成统一到一条支持自主创建和语言驱动定制的流水线中。
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
研究者将图像篡改定位(IML)重新解释为隐变量问题 P(y|x)=∫P(y|z)P(z|x)dz,其中 z 表示伪影,并指出当前 IML 模型不足的根源在于隐式建模伪影。
ReVar3R 提出一种无需重训练、不修改冻结模型的扰动不确定性方法,先将预测对齐到统一相似变换框架再计算逐点方差,在 VGGT、π3 和 MASt3R 三个骨干、六个数据集上,18 种条件中有 15 种将 AUSE 降至内置置信度以下。
研究者发布 Western bluebird(Sialia Mexicana)检测与分割基准数据集,包含来自 41 次录制会话的 6000 多张 4K 野外图像,鸟类仅占画面很小部分。
GSCV 提出一种利用标准视频编解码器的 Gaussian Splatting(GS)序列压缩方法,通过 Inter-PLAS 增强 GS 在 I 帧与 P 帧之间的帧间相关性,无需依赖追踪信息。
一项真实道路驾驶研究对可穿戴眼动追踪的注视精度进行了量化,41 个有效场景中驾驶员注视车牌,平均注视误差为 4.58 度。应用室内录制的偏移量校正后,误差降至 1.10 度,全部 41 个场景均有改善。由于该偏移量在不同场次间存在变化,可靠的 BEV 监督可能需要在线重校准和依赖条件的注视不确定性估计。
研究团队发布 VFSSKep 数据集并提出 S³KL 结构感知半监督关键点定位框架,将标注扩展至软腭并纳入大规模无标注数据。S³KL 通过结构感知学习与块混洗的结构表示一致性学习克服空间偏置,仅用 25% 标注数据即超越 100% 标注的全监督学习,达到半监督 SOTA。代码与数据将公开,成果已被 ICME 2026 Oral 接收。
研究扩展了人机回环框架,用5,901个基础模型伪标签(Easy)、860个专家标注困难病例(Medium)和198个共识失败病例(Hard),系统评估了九种细胞分割模型配置下的七种微调策略。
针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。
研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。
PhysLDM 是一种面向体积形变动力学的一次性仿真潜在扩散范式,核心是整体式时空 VAE,在米级场景实现约 2.48 mm 重建精度和最高 78 倍 token 压缩。实验发现复杂形变动力学常呈混沌特性,确定性回归易产生非物理平均值,而扩散模型能更好建模其分布。该模型仅用运动学数据在 Objaverse 规模数据集上训练,即可零样本泛化到 GSO 和 Toys4K 等 OOD 数据集。
研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。
GeoWM 是一种几何世界模型,可直接预测指定未来时刻的场景几何,无需递归 rollout。它利用几何基础模型将观测 RGB 帧转为几何历史,再通过 flow-matching transformer 预测未来几何,并用轻量相机运动预测器估计未来视角。
研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。
研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。
这篇综述对植物病害检测的视觉与深度学习方法进行了批判性分析,重点聚焦数据集问题,并基于采集场景、可获取性、植物多样性、病害构成、类别结构与失衡程度建立了分类体系。
研究团队为巴基斯坦旁遮普构建了结合 Random Forest、XGBoost、支持向量回归与 Ridge 堆叠集成、并搭配 MobileNetV2 叶片健康分类器的作物产量预测原型,部署为带 SHAP 解释的 Web 应用。
Artemis 是一个几何驱动的多智能体驾驶世界模型,通过从多智能体观测重建显式 3D 世界地图来统一各智能体的 3D 状态,提升跨视角一致性。其 GeoAdapter 模块可将动作引导生成的前景-背景控制图注入扩散 Transformer,并能区分非智能体的无控动态。
研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。
研究者发布 SynAM-E,首个面向金属增材制造熔池监测的公开多源仿真事件相机基准,包含来自 8 家机构 15 个来源的 85 个物理校准事件分片,并提供公开基线与固定跨机器评测划分。
BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。
UniPro 是一个统一的多模式医学图像分割模型,通过传播机制把 2D 分割扩展到 3D 体数据,在单一基于切片的框架内同时支持语义分割、上下文分割、交互式分割和基于传播的分割。
研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。
DivLM 是一个面向 LLM 创意短篇故事生成的后训练框架,通过持续预训练加权重残差恢复指令跟随能力,再用自定义复合奖励的强化学习,在体裁、语气、风格和命名实体四个维度上提升多样性。在两个 LLM 系列上的实验显示,其多样性指标平均提升超过 9%,同时保持指令跟随、整体回复质量和与人类输出的相似度。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。