跳到正文
今天10月7日周三548 条
  1. arXiv cs.CV22

    HRDexDB:跨人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。

  2. arXiv cs.CV24

    MT-cGAN:无需高分辨率形态学图像即可自动分割全膝关节软骨与半月板并可靠量化 T1ρ 和 T2

    研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。

  3. arXiv cs.CV27

    基于运动的 AI 生成视频检测器存在数据集偏差与捷径学习

    研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。

  4. arXiv cs.CV18

    基于标注保留扩散增强的夜间行人检测:Contrastive-SDXL 缓解光照域偏移

    Contrastive-SDXL 是一个基于 SDXL-Turbo 并用 LoRA 微调的日转夜增强框架,用于夜间行人检测。它引入由 DINOv2 编码器引导的 patch-wise 语义对比损失和物体一致性损失,生成图像的 FID 为 22.5。用其合成图像训练的检测器相比仅用白天数据的基线漏检率降低 6-7%,接近真实夜间数据训练的效果。

  5. arXiv cs.CV13

    面向噪声参与度识别的机器遗忘:按主体移除有害数据

    研究将主体级机器遗忘用作参与度识别的后处理净化机制:在已训练模型上排序有害主体并做轻量近似遗忘更新,无需完整重训。在 DAiSEE 和 EngageNet 上以 TCCT-Net 为固定平台,K=3 遗忘集设置下分别恢复 oracle 增益的 92.5% 和 89.3%,成本约为重训的四分之一。效果在中等遗忘集规模时最强,依赖主体选择质量与移除机制。

  6. arXiv cs.CV22

    面向 3D Gaussian Splatting 的场景无关物体中心表示学习

    研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。

  7. arXiv cs.CV18

    AdaRAG-CT:自适应检索增强的 3D CT 报告生成框架

    针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。

  8. arXiv cs.CV27

    Cultural Counterfactuals:用反事实样本评估大型视觉语言模型的文化偏见

    研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。

  9. arXiv cs.CV24

    MedVAR:面向多解剖区域医学图像生成的可扩展下一尺度自回归模型

    MedVAR 是首个通过自回归训练实现全方位医学图像生成的基础模型,在 40 个数据集共 438,905 张切片上训练,覆盖 CT 和 MRI 的六个解剖区域,生成速度比 100 步扩散基线快 12-19 倍。生成质量随模型规模提升,用其生成图像预训练可将七中心肝细胞癌分割 Dice 从 0.615 提升至 0.632。

  10. arXiv cs.CV33

    深度伪造检测的缩放定律研究:ScaleDF 数据集与幂律规律

    研究系统分析了深度伪造检测中的缩放定律,发现检测平均误差随真实图像域数量或伪造生成方法数量增加呈可预测的幂律衰减,类似大语言模型的缩放规律。为此构建了 ScaleDF 数据集,包含来自 51 个数据集的超 580 万张真实图像和 102 种方法生成的超 880 万张伪造图像。该规律可用于预测达到目标性能所需的额外域或方法数量,并以数据为中心应对不断演进的深度伪造技术。

  11. arXiv cs.CV22

    用引导扩散模型分析 DNN 特征空间

    研究者提出一种引导扩散模型解码器,可生成特征与用户指定特征高度匹配的图像,从而精确分析视觉 DNN 的特征空间。该方法无需训练即可分析不同 DNN,且可在单块商用 GPU 上运行,在 CLIP 图像编码器和 ResNet-50 上的实验验证了其有效性。代码与数据已公开。

  12. arXiv cs.CV24

    UltraDiff:面向超声形状优化的可微光线追踪框架

    UltraDiff 将可微渲染范式扩展到医学超声,把超声成像建模为以飞行时间门控的路径空间积分,并推导出前向模型及场景参数梯度的 Monte Carlo 估计器。该框架基于 Mitsuba 3 实现,在逆几何估计任务中从球体出发优化 SDF,可从模拟 B 超扫查和真实脊柱体模机器人采集中恢复椎体表面,无需预分割图像即可在 B 超图像上无监督完成,几何精度与当前最优方法相当。

  13. arXiv cs.CV30

    ROMA:面向真实世界物体中心多感官主动感知的 LLM 系统

    ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。

  14. arXiv cs.CV29

    从单张图像构建罗马:Trellis 2 改造实现室内外场景 3D 重建

    研究者提出一种方法,将 Trellis 2 等以物体为中心的 3D 生成器改造为可处理室内外场景的单图 3D 重建。方法通过按相机距离自适应分块、建立显式 2D-3D 对应关系,并合成约 4,000 个室外场景扩充训练数据。在 Tanks and Temples、ScanNet++ 及真实图像上,该方法在几何精度和感知质量上均优于所有基线。

  15. arXiv cs.CV26

    ALIVE:面向首帧引导视频编辑的交互对齐物体插入框架

    ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。

  16. arXiv cs.CV22

    基于 Patch 的高光谱图像分类中的数据泄漏:量化空间重叠的影响

    研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。

  17. arXiv cs.CV22

    基于基础模型引导扩散的 LiDAR 分辨率恢复

    研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。

  18. arXiv cs.CV17

    基于解剖感知隐式神经表示的可变形 CT-超声配准

    研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。

  19. arXiv cs.CV22

    BFG:面向隐私友好 AIoT 的图像比特流细粒度理解基础模型

    研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。

  20. arXiv cs.CV22

    UP-MOPD:多教师在线策略蒸馏中的更新投影

    针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。