CCDF:面向真实监控场景深伪检测的基准数据集
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。
研究者将图像篡改定位(IML)重新解释为隐变量问题 P(y|x)=∫P(y|z)P(z|x)dz,其中 z 表示伪影,并指出当前 IML 模型不足的根源在于隐式建模伪影。
研究提出无监督长尾适配(ULTA)新场景,发现现有视觉语言模型适配方法在长尾分布下头部类别性能急剧下降,与监督长尾学习中尾部类别受损的现象相反。为此提出 MARS 模型,通过 Boundary-Preserving Alignment 和 Margin-aware Self-Refinement 缓解头部类别边界侵蚀并修正尾部与易混淆类别。
ReVar3R 提出一种无需重训练、不修改冻结模型的扰动不确定性方法,先将预测对齐到统一相似变换框架再计算逐点方差,在 VGGT、π3 和 MASt3R 三个骨干、六个数据集上,18 种条件中有 15 种将 AUSE 降至内置置信度以下。
CueRator 是一个通过智能体搜索决策规则来适配冻结对比式多模态编码器的框架,在 OV-AVEBench 上将总平均分从 57.8 提升至 60.2,未见类别性能从 55.8 提升至 59.9,并将已见-未见差距从 7.1 缩小至 1.2。
研究者发布 Western bluebird(Sialia Mexicana)检测与分割基准数据集,包含来自 41 次录制会话的 6000 多张 4K 野外图像,鸟类仅占画面很小部分。
GSCV 提出一种利用标准视频编解码器的 Gaussian Splatting(GS)序列压缩方法,通过 Inter-PLAS 增强 GS 在 I 帧与 P 帧之间的帧间相关性,无需依赖追踪信息。
一项真实道路驾驶研究对可穿戴眼动追踪的注视精度进行了量化,41 个有效场景中驾驶员注视车牌,平均注视误差为 4.58 度。应用室内录制的偏移量校正后,误差降至 1.10 度,全部 41 个场景均有改善。由于该偏移量在不同场次间存在变化,可靠的 BEV 监督可能需要在线重校准和依赖条件的注视不确定性估计。
研究者提出 Foveated Compression,将全分辨率图像编码一次,用原生分辨率与压缩分辨率视觉 token 混合表示,并训练行为自蒸馏的 Foveated Merger 与轻量 Foveated Selector 从九个空间单元中选一个保留原生分辨率。
研究团队发布 VFSSKep 数据集并提出 S³KL 结构感知半监督关键点定位框架,将标注扩展至软腭并纳入大规模无标注数据。S³KL 通过结构感知学习与块混洗的结构表示一致性学习克服空间偏置,仅用 25% 标注数据即超越 100% 标注的全监督学习,达到半监督 SOTA。代码与数据将公开,成果已被 ICME 2026 Oral 接收。
研究扩展了人机回环框架,用5,901个基础模型伪标签(Easy)、860个专家标注困难病例(Medium)和198个共识失败病例(Hard),系统评估了九种细胞分割模型配置下的七种微调策略。
RBMatch 是一个双层类别重平衡框架,同时调控伪标签生成与无监督优化,以缓解遥感建筑足迹提取中的前景-背景失衡问题。该框架包含自适应类别阈值(ACT)、置信度感知类别平衡重加权(CACBR)和分布对齐(DAL)三个组件。
针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。
研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。
PhysLDM 是一种面向体积形变动力学的一次性仿真潜在扩散范式,核心是整体式时空 VAE,在米级场景实现约 2.48 mm 重建精度和最高 78 倍 token 压缩。实验发现复杂形变动力学常呈混沌特性,确定性回归易产生非物理平均值,而扩散模型能更好建模其分布。该模型仅用运动学数据在 Objaverse 规模数据集上训练,即可零样本泛化到 GSO 和 Toys4K 等 OOD 数据集。
AIMS 是一种可扩展的新视角合成框架,通过最远点采样选取固定数量的空间分布锚点视角,并用轻量级可学习集成器将邻近观测融合为增强锚点表示,使可用观测数量与全局合成模型处理的视角数解耦。
LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。
针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。
研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。
GeoWM 是一种几何世界模型,可直接预测指定未来时刻的场景几何,无需递归 rollout。它利用几何基础模型将观测 RGB 帧转为几何历史,再通过 flow-matching transformer 预测未来几何,并用轻量相机运动预测器估计未来视角。
SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。
研究者提出免训练框架 HGSS(Hierarchically Grounded Semantic Surgery),通过层级跨度定位与动态属性绑定,在不更新模型权重的前提下实现组合式概念擦除。
研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。
研究提出一种基于计算机视觉的深度学习方法,用于在板球比赛中实时检测非法投球动作。系统从投球视频中提取肩部帧和出手帧,分析两帧间投球手臂角度变化,若角度差超过预设阈值(如 15 度)则判定为疑似非法投球。团队构建了包含 11 名男性投手、62 段视频的数据集,系统取得较高真阳性率,但数据集以右手常规动作为主,仍需在更多样环境和更大数据集上验证。
研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。
研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。
这篇综述对植物病害检测的视觉与深度学习方法进行了批判性分析,重点聚焦数据集问题,并基于采集场景、可获取性、植物多样性、病害构成、类别结构与失衡程度建立了分类体系。
研究团队为巴基斯坦旁遮普构建了结合 Random Forest、XGBoost、支持向量回归与 Ridge 堆叠集成、并搭配 MobileNetV2 叶片健康分类器的作物产量预测原型,部署为带 SHAP 解释的 Web 应用。
Artemis 是一个几何驱动的多智能体驾驶世界模型,通过从多智能体观测重建显式 3D 世界地图来统一各智能体的 3D 状态,提升跨视角一致性。其 GeoAdapter 模块可将动作引导生成的前景-背景控制图注入扩散 Transformer,并能区分非智能体的无控动态。
WiSPER 是一个两阶段框架,将姿态感知的预测式预训练与条件残差流精修结合,用于 WiFi CSI 多人 3D 姿态估计,训练需配对 CSI 与姿态标注,推理仅需 CSI。
DTFormer 是一个三模态(RGB-D-Text)语义分割框架,通过 Text-guided Semantic Alignment Module(TSAM)将文本线索编码为语义原型,并在编码器和解码器多层显式对齐 RGB-D 多模态特征,从而对表示学习施加语义正则。
研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。
研究者提出 State-Aware Interaction MIL,一种弱监督方法,保留各生物标志物特异的组织学表征并建模其交互,同时监督完整的四态分子配置。
研究者发布 SynAM-E,首个面向金属增材制造熔池监测的公开多源仿真事件相机基准,包含来自 8 家机构 15 个来源的 85 个物理校准事件分片,并提供公开基线与固定跨机器评测划分。
BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。
DistScene 是一个从单张图像生成组合式 3D 场景的框架,将环境作为显式场景组件与物体联合建模,以提供物体摆放的几何上下文。
针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。
UniPro 是一个统一的多模式医学图像分割模型,通过传播机制把 2D 分割扩展到 3D 体数据,在单一基于切片的框架内同时支持语义分割、上下文分割、交互式分割和基于传播的分割。