跳到正文
今天10月7日周三1231 条
  1. arXiv cs.CV29

    CCDF:面向真实监控场景深伪检测的基准数据集

    研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。

  2. arXiv cs.CV22

    TF-PRVR:免训练的部分相关视频检索框架

    TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。

  3. arXiv cs.CV22

    视觉语言模型的无监督长尾适配:MARS 方法提升 4.71 个百分点

    研究提出无监督长尾适配(ULTA)新场景,发现现有视觉语言模型适配方法在长尾分布下头部类别性能急剧下降,与监督长尾学习中尾部类别受损的现象相反。为此提出 MARS 模型,通过 Boundary-Preserving Alignment 和 Margin-aware Self-Refinement 缓解头部类别边界侵蚀并修正尾部与易混淆类别。

  4. arXiv cs.CV17

    从实验室到道路:评估驾驶场景下可穿戴眼动追踪的注视精度

    一项真实道路驾驶研究对可穿戴眼动追踪的注视精度进行了量化,41 个有效场景中驾驶员注视车牌,平均注视误差为 4.58 度。应用室内录制的偏移量校正后,误差降至 1.10 度,全部 41 个场景均有改善。由于该偏移量在不同场次间存在变化,可靠的 BEV 监督可能需要在线重校准和依赖条件的注视不确定性估计。

  5. arXiv cs.CV15

    VFSSKep 数据集与 S³KL 框架:面向视频荧光吞咽研究的结构感知关键点定位

    研究团队发布 VFSSKep 数据集并提出 S³KL 结构感知半监督关键点定位框架,将标注扩展至软腭并纳入大规模无标注数据。S³KL 通过结构感知学习与块混洗的结构表示一致性学习克服空间偏置,仅用 25% 标注数据即超越 100% 标注的全监督学习,达到半监督 SOTA。代码与数据将公开,成果已被 ICME 2026 Oral 接收。

  6. arXiv cs.CV12

    AM²ES:面向生存预测的锚点驱动多模态多尺度专家选择框架

    针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。

  7. arXiv cs.CV22

    SALM:通过结构感知隐空间掩码建模解锁 CLIP 细粒度感知能力

    研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。

  8. arXiv cs.CV22

    PhysLDM:面向高保真形变仿真的潜在扩散模型

    PhysLDM 是一种面向体积形变动力学的一次性仿真潜在扩散范式,核心是整体式时空 VAE,在米级场景实现约 2.48 mm 重建精度和最高 78 倍 token 压缩。实验发现复杂形变动力学常呈混沌特性,确定性回归易产生非物理平均值,而扩散模型能更好建模其分布。该模型仅用运动学数据在 Objaverse 规模数据集上训练,即可零样本泛化到 GSO 和 Toys4K 等 OOD 数据集。

  9. arXiv cs.CV23

    LARK:低成本、高精度、抗遮挡的卡尔曼滤波辅助图像引导手术跟踪系统

    LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。

  10. arXiv cs.CV24

    SRIM:面向恶意编辑的尺度鲁棒图像免疫保护扰动方法

    针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。

  11. arXiv cs.CV22

    视觉语言模型微调中的语义能力获取与特化

    研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。

  12. arXiv cs.CV18

    SimCortex v2:近乎零碰撞与自交的联合皮层表面重建

    SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。

  13. arXiv cs.CV22

    LAO-X:无需人工标注即可定位 X 光安检扫描中的任意物体

    研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。

  14. arXiv cs.CV12

    基于深度学习的板球非法投球动作检测

    研究提出一种基于计算机视觉的深度学习方法,用于在板球比赛中实时检测非法投球动作。系统从投球视频中提取肩部帧和出手帧,分析两帧间投球手臂角度变化,若角度差超过预设阈值(如 15 度)则判定为疑似非法投球。团队构建了包含 11 名男性投手、62 段视频的数据集,系统取得较高真阳性率,但数据集以右手常规动作为主,仍需在更多样环境和更大数据集上验证。

  15. arXiv cs.CV22

    CALR:通过 Render-of-Thought 压缩实现连续锚定潜在推理

    研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。

  16. arXiv cs.CV22

    R2RI:面向机器人间交互的多视角事件与 RGB 数据集

    研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。

  17. arXiv cs.CV24

    MoonGS:用图像对鲁棒深度特征实现月表高质量高斯泼溅重建

    MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。

  18. arXiv cs.CV12

    面向可泛化小样本类增量学习:学习筛选你生成的数据

    研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。

  19. arXiv cs.CV24

    BoT-Feedback:用生物力学证据为多模态推理提供依据,实现可解释的人体动作反馈

    BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。

  20. arXiv cs.CV24

    超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型

    针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。