跳到正文
今天10月7日周三1093 条
  1. arXiv cs.CV22

    SymNetPro:基于稀疏无线电观测的 LOS 感知定向多发射机定位

    SymNetPro 在 SymNet 的双任务无线电地图重建与定位骨干上新增两个组件:稀疏 LOS 感知注意力偏置和发射机丢弃增强,用于从稀疏接收功率观测中定位多个定向发射机。在定向射线追踪城市环境实验中,其 OSPA 在极端稀疏采样下显著低于代表性定位基线,并在测量噪声和发射机数量增加时保持稳定增益。代码、数据集和模型检查点已公开。

  2. arXiv cs.CV22

    HRDexDB:跨人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。

  3. arXiv cs.CV27

    ChronoWorld:用时空线索与几何反射实现相机可控的一致 4D 世界生成

    ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。

  4. arXiv cs.CV24

    MT-cGAN:无需高分辨率形态学图像即可自动分割全膝关节软骨与半月板并可靠量化 T1ρ 和 T2

    研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。

  5. arXiv cs.CV20

    LoDEOT:用低维高效偏移 token 从倾斜影像提取建筑轮廓

    LoDEOT 用五维偏移 token 替代高维实例 token 来预测屋顶到轮廓偏移(RFO),在保留高维实例 token 做检测与分割的同时,将实例 token、浓度门控屋顶和框掩码证据映射为五维偏移 token,再经独立二维读出。在 BONAI 数据集上,其 FAP50 达 54.58、mEPE 为 5.23 像素,FAP50 比所评估的端到端基线高出 7.56-16.85 个百分点。

  6. arXiv cs.CV22

    SteadySplats:低方差高斯重采样实现高保真随机渲染

    SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。

  7. arXiv cs.CV22

    VolS-GS:基于体素次表面散射的可重光照 Gaussian Splatting 框架

    VolS-GS 是一个可重光照的 Gaussian Splatting 框架,通过将高斯场景的空间支撑作为可微有限体积传输求解器的域,让光线在物体内部传播,从而建模次表面散射等非局部效应。该框架用小型网络为每个 Gaussian 预测散射与吸收系数,并在三个 OLAT 基准上持续提升新光照与新视角下的重光照质量。

  8. arXiv cs.CV22

    DiDE:面向 3D 风格化的颜色-纹理解耦直接注入框架

    DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。

  9. arXiv cs.CV22

    4D 场景重建综述:以场景表示为中心的动态世界重建统一视角

    一篇综述从场景表示、时序建模、重建流程与优化目标四个维度统一梳理 4D 场景重建方法,涵盖 NeRF 与 3D Gaussian Splatting 等路线。该框架分析了不同设计选择对几何保真度、外观一致性、运动表示与计算效率的影响,并整理了常用数据集与评测指标,指出当前实验实践的局限与开放挑战。相关论文与资源集合持续更新。

  10. arXiv cs.CV24

    TripleFlow:无需训练的视频对象移除,桥接残差编辑与原生生成

    TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。

  11. arXiv cs.CV22

    MeshOctave:用顶点拆分重连级联实现原生网格生成

    研究者提出 MeshOctave,通过二进空间网格分辨率定义尺度,将网格粗化视为体素单元内顶点合并的确定性坍缩,并用 split-and-rewire 逆操作逐面确定八分体子顶点与局部连接,无需序列化即可并行生成。该方法采用尺度条件掩码均匀离散扩散模型学习该操作,在几何保真度与拓扑有效性上大幅超越强基线,并支持自适应分辨率细化与网格细分任务。

  12. arXiv cs.CV22

    基于轨迹对齐字形渲染的视频文本编辑方法,在 VTEdit 基准上实现 0.9408 句子准确率

    研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。

  13. arXiv cs.CV24

    HARMONY:面向单目图像到场景合成的分层智能体推理框架

    HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。

  14. arXiv cs.CV22

    从潜在分布视角评估与改进潜在生成模型

    针对重建 FID(rFID)与生成 FID(gFID)相关性弱甚至为负的问题,研究者提出生成感知重建(GAR),通过向编码器 latent 加噪并经生成模型去噪,构建从重建到生成的连续轨迹。基于该轨迹的诊断指标 GAR-FID 在多种 tokenizer 和规模下与 gFID 强相关,且中间 GAR latent 保留与源图像的配对监督,可用于解码器适配,在不同模型规模上持续提升生成质量。

  15. arXiv cs.CV22

    RIGOR:面向全景视频重建的虚拟四目装置几何方法

    RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。

  16. arXiv cs.CV17

    LEADer:局部认知不确定性引导的即插即用扩散图像修复主动采样框架

    研究者提出局部认知不确定性引导主动采样框架 LEADer,用于扩散模型图像修复(DMIR)。该方法在空间域用逐像素不确定性动态调节零空间先验强度,在时间域用不确定性轨迹量化采样稳定性以实现自适应轨迹剪枝,理论证明其满足严格数据一致性且剪枝策略具有确定性误差界。LEADer 可即插即用地集成到多种 DMIR 基线,在提升多个 SOTA 方法性能的同时显著减少采样时间,内存开销可忽略,代码已开源。

  17. arXiv cs.CV22

    Latent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别

    研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。

  18. arXiv cs.CV22

    基于 YOLO-World 的无人机多模态目标定位模型,用 A2C2f 注意力层提升小目标检测

    一项研究在 YOLO-World 框架上提出多模态目标检测模型,用基于注意力的 A2C2f 层替换 YOLOv8 主干中的 C2f 层,以更精确表征小目标局部特征。在 VisDrone 数据集上,该模型精度从 43.0% 提升至 45.1%,召回率从 32.8% 升至 35.0%,mAP@0.5 从 32.5% 提高到 35.2%,mAP@0.5-0.95 从 18.5% 升至 19.9%。

  19. arXiv cs.CV27

    基于运动的 AI 生成视频检测器存在数据集偏差与捷径学习

    研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。

  20. arXiv cs.CV22

    RefGC-SR²:AI 生成内容的参考引导超分辨率与精修

    研究者提出新任务 RefGC-SR²,在生成后处理阶段复用用户提供的原始高分辨率参考图,同时恢复丢失细节、修正生成伪影并放大输出。为此构建了首个真实场景三元组数据生成流程,并训练出双联图条件生成器来合成配对低质锚点。所提出的频率感知扩散 Transformer 模型能选择性注入参考图细节并去除伪影,在身份保真与高分辨率细节恢复上均优于现有 RefGCR 和 RefSR 基线。

  21. arXiv cs.CV31

    SalArt-VQA:诊断 VLM 能否理解生成图像中的显著伪影

    研究团队推出诊断基准 SalArt-VQA,包含 950 张图像和 3,681 道人工编写多选题,用于评估 VLM 对 AI 生成图像中显著伪影的细粒度理解。在 20 个 VLM 上测试发现,最强模型伪影检测召回率达 99.37%,但四类伪影问题全部答对的图像仅占 53.26%。该基准已入选 NeurIPS 2026 E&D Track(Oral)。

  22. arXiv cs.CV27

    FindIt:面向通用多模态 LLM 的格式感知视觉检测基准

    研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。

  23. arXiv cs.CV23

    研究:文本到图像模型对文本编码器的依赖比想象中更少

    一项 arXiv 研究显示,基于扩散 Transformer 的文本到图像模型通常只依赖文本表示中两个简单方面:相邻 token 合并为词表示,以及由文本编码器位置嵌入刻画的词序。研究者构造了仅编码单词含义与顺序、不含完整提示词上下文信息的"位置标记词袋"嵌入,发现其引导生成的视觉质量与文本保真度与完整文本嵌入相当,说明复杂语言结构的解码实际由图像模型自身完成。

  24. arXiv cs.CV18

    基于标注保留扩散增强的夜间行人检测:Contrastive-SDXL 缓解光照域偏移

    Contrastive-SDXL 是一个基于 SDXL-Turbo 并用 LoRA 微调的日转夜增强框架,用于夜间行人检测。它引入由 DINOv2 编码器引导的 patch-wise 语义对比损失和物体一致性损失,生成图像的 FID 为 22.5。用其合成图像训练的检测器相比仅用白天数据的基线漏检率降低 6-7%,接近真实夜间数据训练的效果。