基于解剖感知隐式神经表示的可变形 CT-超声配准
研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。
研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。
研究者提出 ConnectomeX 与 FlyVision,一种保留 ON/OFF 并行处理、循环计算和群体图交互的可训练架构。
针对 LipSync 伪造视频,研究者提出联合检测与溯源框架 LipDA,利用自然语音中唇动与头部姿态的生物学耦合,通过对比真实与伪造视频的唇部、姿态特征量化二者不一致性,并捕捉各生成模型特有的时序动态与音视频同步模式实现来源溯源。
研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。
针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。
UniCounting 提出固定词表、无需图像查询的多类别计数方法,仅输入 RGB 图像即可输出完整的类别—计数向量。它用冻结的 SAM 2.1 生成掩码、DINOv2 与 OpenCLIP 提供关系与类别特征,仅训练一个 3,267 参数的类别共享关系头预测同实例亲和度。
研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。
PolarScale 是一个将辐射尺度作为显式预测与评估目标的 RGB-to-Stokes 基准,基于现有三色全 Stokes 测量,要求模型预测归一化 Stokes 分量、AoLP/DoLP/DoCP 及每场景尺度。
数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。
一项持续学习研究在 YOLOMG(基于 YOLOv5 的热红外检测器)上顺序训练 Anti-UAV-RGBT、Anti-UAV410 和 CST Anti-UAV 三个反无人机基准,朴素微调在 CST 上对第一阶段上限的遗忘度量 FM 为 -0.605,相当于 90% 能力损失。
EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。
一项多模型审计在儿童数据集上测试了 EmoNet、EmotiEffLib、DDAMFN++、OpenFace 3.0、LibreFace 五个 AffectNet 预训练表情模型,发现儿童性能下降与架构无关,且集中在张嘴(被误读为 surprise,与 AU26 下巴张开相关)和南亚裔儿童上。
TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。
诺丁汉大学团队提出 RACE-FPP,将深度学习角点检测融入条纹投影轮廓术(FPP)标准标定流程,并显式分析定位误差在整条标定链中的传播。在干净与退化图像混合数据集上,相机重投影误差从 1.237 像素降至 0.259 像素,投影仪重投影误差降低约 50%,重建工件的几何精度也优于传统流程。
MacJEPA 是一种缺失模态鲁棒的音视频识别模型,将第一视角模态缺失重新定义为未剪辑多事件视频中时间局部的传感器中断,并通过窗口级模态 dropout 模拟训练。
PIE-PS 是一个从原始事件流和已知光照重建稠密表面法线的学习框架,通过将同一像素相邻两个事件与其光照方向配对构建 Physical Irradiance Events(PIEs),其 PIEF 特征无需未知对比度阈值。
View Matters 是一个视图重要性感知的文本驱动 3D Gaussian 编辑框架,通过关键帧重要性估计(KIE)识别可靠视图,再经关键帧引导编辑(KGE)将编辑信号非对称传播至非关键帧,并用重要性感知优化(IAO)在 3DGS 优化中保持该偏好。在 23 组场景-提示词对上,其平均 CLIP 文本-图像相似度达 0.2822、方向相似度达 0.2564,编辑耗时四分钟。
研究团队提出一种基于 Transformer 的重建框架,将冻结及参数高效微调的 CLIP、BiomedCLIP、DINOv2 视觉编码器用作心脏 MRI 加速重建的先验。
研究团队构建了 SkinLex,一个整合 SkinCon、DermaCon-IN、MM-Skin 和 PASSION 四个公开数据集、涵盖 48 种临床形态学属性、共 20,411 条记录的统一数据集。
研究提出相位速度蒸馏(PVD),将生成过程分为粗、细两个阶段,各用一个半尺寸专家模型建模平均速度,累计计算量仅相当于一次完整骨干前向。
PhysTacGen 是一个视觉到光学触觉图像生成框架,通过融合材料感知描述与几何条件来合成触觉图像。
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
EmbodiedSmith 是一个通过递归自我改进(RSI)实现可扩展具身数据生成的框架,将资产、场景与任务生成统一到一条支持自主创建和语言驱动定制的流水线中。
DensiTok 是一个可插拔模块,能直接加密预训练前馈 3DGS 模型的内部几何 token,让冻结的主干网络表现得像观测到远多于输入的视角。它把 token 压缩到紧凑隐空间,以相机几何为条件用单步 flow-matching 补全未观测视角的隐变量,再解码回 token 供原重建头使用,无需图像合成或额外编码器。
MoRE(Mixture of Reward Experts)通过强化学习将五个冻结的数值预测器的坐标级先验迁移到预训练语言轨迹预测器中,专家预测转为奖励并经不确定性加权共识融合。在 ETH-UCY 上,ADE 从 0.22 降至 0.20 m,FDE 从 0.32 降至 0.29 m;相对基础策略,ADE 在 SDD 上下降 17.9%、在 NBA 上下降 12.7%,且未增加推理内存或延迟。
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。
研究者将图像篡改定位(IML)重新解释为隐变量问题 P(y|x)=∫P(y|z)P(z|x)dz,其中 z 表示伪影,并指出当前 IML 模型不足的根源在于隐式建模伪影。
研究提出无监督长尾适配(ULTA)新场景,发现现有视觉语言模型适配方法在长尾分布下头部类别性能急剧下降,与监督长尾学习中尾部类别受损的现象相反。为此提出 MARS 模型,通过 Boundary-Preserving Alignment 和 Margin-aware Self-Refinement 缓解头部类别边界侵蚀并修正尾部与易混淆类别。
ReVar3R 提出一种无需重训练、不修改冻结模型的扰动不确定性方法,先将预测对齐到统一相似变换框架再计算逐点方差,在 VGGT、π3 和 MASt3R 三个骨干、六个数据集上,18 种条件中有 15 种将 AUSE 降至内置置信度以下。
CueRator 是一个通过智能体搜索决策规则来适配冻结对比式多模态编码器的框架,在 OV-AVEBench 上将总平均分从 57.8 提升至 60.2,未见类别性能从 55.8 提升至 59.9,并将已见-未见差距从 7.1 缩小至 1.2。
研究者发布 Western bluebird(Sialia Mexicana)检测与分割基准数据集,包含来自 41 次录制会话的 6000 多张 4K 野外图像,鸟类仅占画面很小部分。
GSCV 提出一种利用标准视频编解码器的 Gaussian Splatting(GS)序列压缩方法,通过 Inter-PLAS 增强 GS 在 I 帧与 P 帧之间的帧间相关性,无需依赖追踪信息。
一项真实道路驾驶研究对可穿戴眼动追踪的注视精度进行了量化,41 个有效场景中驾驶员注视车牌,平均注视误差为 4.58 度。应用室内录制的偏移量校正后,误差降至 1.10 度,全部 41 个场景均有改善。由于该偏移量在不同场次间存在变化,可靠的 BEV 监督可能需要在线重校准和依赖条件的注视不确定性估计。
研究者提出 Foveated Compression,将全分辨率图像编码一次,用原生分辨率与压缩分辨率视觉 token 混合表示,并训练行为自蒸馏的 Foveated Merger 与轻量 Foveated Selector 从九个空间单元中选一个保留原生分辨率。
研究团队发布 VFSSKep 数据集并提出 S³KL 结构感知半监督关键点定位框架,将标注扩展至软腭并纳入大规模无标注数据。S³KL 通过结构感知学习与块混洗的结构表示一致性学习克服空间偏置,仅用 25% 标注数据即超越 100% 标注的全监督学习,达到半监督 SOTA。代码与数据将公开,成果已被 ICME 2026 Oral 接收。
研究扩展了人机回环框架,用5,901个基础模型伪标签(Easy)、860个专家标注困难病例(Medium)和198个共识失败病例(Hard),系统评估了九种细胞分割模型配置下的七种微调策略。
RBMatch 是一个双层类别重平衡框架,同时调控伪标签生成与无监督优化,以缓解遥感建筑足迹提取中的前景-背景失衡问题。该框架包含自适应类别阈值(ACT)、置信度感知类别平衡重加权(CACBR)和分布对齐(DAL)三个组件。
针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。
研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。