跳到正文
今天10月7日周三1089 条
  1. arXiv cs.CV17

    基于解剖感知隐式神经表示的可变形 CT-超声配准

    研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。

  2. arXiv cs.CV22

    BFG:面向隐私友好 AIoT 的图像比特流细粒度理解基础模型

    研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。

  3. arXiv cs.CV22

    UP-MOPD:多教师在线策略蒸馏中的更新投影

    针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。

  4. arXiv cs.CV17

    用 Stevens 幂律检验 GPT-5.5 的图像可视化读取能力

    研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。

  5. arXiv cs.CV22

    数字孪生驱动的 Real2Sim2Real:通过配对驾驶场景重建实现模拟器条件生成

    数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。

  6. arXiv cs.CV12

    EventNet:用 2D 关键点检测乒乓球视频事件

    EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。

  7. arXiv cs.CV31

    TSRN-RTVD:实时视频去模糊系统

    TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。

  8. arXiv cs.CV17

    RACE-FPP:面向条纹投影轮廓术的鲁棒 AI 辅助标定增强方法

    诺丁汉大学团队提出 RACE-FPP,将深度学习角点检测融入条纹投影轮廓术(FPP)标准标定流程,并显式分析定位误差在整条标定链中的传播。在干净与退化图像混合数据集上,相机重投影误差从 1.237 像素降至 0.259 像素,投影仪重投影误差降低约 50%,重建工件的几何精度也优于传统流程。

  9. arXiv cs.CV15

    View Matters:关键帧引导的文本驱动 3D Gaussian 编辑框架

    View Matters 是一个视图重要性感知的文本驱动 3D Gaussian 编辑框架,通过关键帧重要性估计(KIE)识别可靠视图,再经关键帧引导编辑(KGE)将编辑信号非对称传播至非关键帧,并用重要性感知优化(IAO)在 3DGS 优化中保持该偏好。在 23 组场景-提示词对上,其平均 CLIP 文本-图像相似度达 0.2822、方向相似度达 0.2564,编辑耗时四分钟。

  10. arXiv cs.CV22

    M3SunAgent:面向度量深度估计与3D视觉定位的单目3D空间理解智能体

    研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。

  11. arXiv cs.CV22

    DensiTok:让前馈 3D Gaussian Splatting 看到比输入更多的视角

    DensiTok 是一个可插拔模块,能直接加密预训练前馈 3DGS 模型的内部几何 token,让冻结的主干网络表现得像观测到远多于输入的视角。它把 token 压缩到紧凑隐空间,以相机几何为条件用单步 flow-matching 补全未观测视角的隐变量,再解码回 token 供原重建头使用,无需图像合成或额外编码器。

  12. arXiv cs.CV19

    MoRE:用奖励专家混合框架改进基于语言的轨迹预测

    MoRE(Mixture of Reward Experts)通过强化学习将五个冻结的数值预测器的坐标级先验迁移到预训练语言轨迹预测器中,专家预测转为奖励并经不确定性加权共识融合。在 ETH-UCY 上,ADE 从 0.22 降至 0.20 m,FDE 从 0.32 降至 0.29 m;相对基础策略,ADE 在 SDD 上下降 17.9%、在 NBA 上下降 12.7%,且未增加推理内存或延迟。

  13. arXiv cs.CV29

    CCDF:面向真实监控场景深伪检测的基准数据集

    研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。

  14. arXiv cs.CV22

    TF-PRVR:免训练的部分相关视频检索框架

    TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。

  15. arXiv cs.CV22

    视觉语言模型的无监督长尾适配:MARS 方法提升 4.71 个百分点

    研究提出无监督长尾适配(ULTA)新场景,发现现有视觉语言模型适配方法在长尾分布下头部类别性能急剧下降,与监督长尾学习中尾部类别受损的现象相反。为此提出 MARS 模型,通过 Boundary-Preserving Alignment 和 Margin-aware Self-Refinement 缓解头部类别边界侵蚀并修正尾部与易混淆类别。

  16. arXiv cs.CV17

    从实验室到道路:评估驾驶场景下可穿戴眼动追踪的注视精度

    一项真实道路驾驶研究对可穿戴眼动追踪的注视精度进行了量化,41 个有效场景中驾驶员注视车牌,平均注视误差为 4.58 度。应用室内录制的偏移量校正后,误差降至 1.10 度,全部 41 个场景均有改善。由于该偏移量在不同场次间存在变化,可靠的 BEV 监督可能需要在线重校准和依赖条件的注视不确定性估计。

  17. arXiv cs.CV15

    VFSSKep 数据集与 S³KL 框架:面向视频荧光吞咽研究的结构感知关键点定位

    研究团队发布 VFSSKep 数据集并提出 S³KL 结构感知半监督关键点定位框架,将标注扩展至软腭并纳入大规模无标注数据。S³KL 通过结构感知学习与块混洗的结构表示一致性学习克服空间偏置,仅用 25% 标注数据即超越 100% 标注的全监督学习,达到半监督 SOTA。代码与数据将公开,成果已被 ICME 2026 Oral 接收。

  18. arXiv cs.CV12

    AM²ES:面向生存预测的锚点驱动多模态多尺度专家选择框架

    针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。

  19. arXiv cs.CV22

    SALM:通过结构感知隐空间掩码建模解锁 CLIP 细粒度感知能力

    研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。