跳到正文
今天10月7日周三176 条
  1. arXiv cs.CV27

    ChronoWorld:用时空线索与几何反射实现相机可控的一致 4D 世界生成

    ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。

  2. arXiv cs.CV22

    DiDE:面向 3D 风格化的颜色-纹理解耦直接注入框架

    DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。

  3. arXiv cs.CV22

    4D 场景重建综述:以场景表示为中心的动态世界重建统一视角

    一篇综述从场景表示、时序建模、重建流程与优化目标四个维度统一梳理 4D 场景重建方法,涵盖 NeRF 与 3D Gaussian Splatting 等路线。该框架分析了不同设计选择对几何保真度、外观一致性、运动表示与计算效率的影响,并整理了常用数据集与评测指标,指出当前实验实践的局限与开放挑战。相关论文与资源集合持续更新。

  4. arXiv cs.CV22

    基于轨迹对齐字形渲染的视频文本编辑方法,在 VTEdit 基准上实现 0.9408 句子准确率

    研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。

  5. arXiv cs.CV24

    HARMONY:面向单目图像到场景合成的分层智能体推理框架

    HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。

  6. arXiv cs.CV22

    RIGOR:面向全景视频重建的虚拟四目装置几何方法

    RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。

  7. arXiv cs.CV22

    Latent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别

    研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。

  8. arXiv cs.CV22

    基于 YOLO-World 的无人机多模态目标定位模型,用 A2C2f 注意力层提升小目标检测

    一项研究在 YOLO-World 框架上提出多模态目标检测模型,用基于注意力的 A2C2f 层替换 YOLOv8 主干中的 C2f 层,以更精确表征小目标局部特征。在 VisDrone 数据集上,该模型精度从 43.0% 提升至 45.1%,召回率从 32.8% 升至 35.0%,mAP@0.5 从 32.5% 提高到 35.2%,mAP@0.5-0.95 从 18.5% 升至 19.9%。

  9. arXiv cs.CV31

    SalArt-VQA:诊断 VLM 能否理解生成图像中的显著伪影

    研究团队推出诊断基准 SalArt-VQA,包含 950 张图像和 3,681 道人工编写多选题,用于评估 VLM 对 AI 生成图像中显著伪影的细粒度理解。在 20 个 VLM 上测试发现,最强模型伪影检测召回率达 99.37%,但四类伪影问题全部答对的图像仅占 53.26%。该基准已入选 NeurIPS 2026 E&D Track(Oral)。

  10. arXiv cs.CV27

    FindIt:面向通用多模态 LLM 的格式感知视觉检测基准

    研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。

  11. arXiv cs.CV23

    研究:文本到图像模型对文本编码器的依赖比想象中更少

    一项 arXiv 研究显示,基于扩散 Transformer 的文本到图像模型通常只依赖文本表示中两个简单方面:相邻 token 合并为词表示,以及由文本编码器位置嵌入刻画的词序。研究者构造了仅编码单词含义与顺序、不含完整提示词上下文信息的"位置标记词袋"嵌入,发现其引导生成的视觉质量与文本保真度与完整文本嵌入相当,说明复杂语言结构的解码实际由图像模型自身完成。

  12. arXiv cs.CV22

    面向 3D Gaussian Splatting 的场景无关物体中心表示学习

    研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。

  13. arXiv cs.CV18

    AdaRAG-CT:自适应检索增强的 3D CT 报告生成框架

    针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。

  14. arXiv cs.CV27

    Cultural Counterfactuals:用反事实样本评估大型视觉语言模型的文化偏见

    研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。

  15. arXiv cs.CV24

    InStyle:3D 形状的即时外观风格化

    研究提出 GaussianBlender,一个前馈式文本驱动 3D 风格化框架,可在推理时即时完成编辑。该方法从空间分组的 3D Gaussian 中学习几何与外观解耦的隐空间,再用潜在扩散模型施加文本条件编辑。评估显示其风格化即时、高保真、保持几何且多视角一致,并超越需逐实例测试时优化的方法。

  16. arXiv cs.CV22

    重新审视视觉溯源:直接视觉生成与 LLM 驱动代码渲染中的检测与水印

    一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。

  17. arXiv cs.CV30

    ROMA:面向真实世界物体中心多感官主动感知的 LLM 系统

    ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。

  18. arXiv cs.CV30

    视频世界模型的物理一致性基准:World Models' Last Exam in Physics

    研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。

  19. arXiv cs.CV26

    ALIVE:面向首帧引导视频编辑的交互对齐物体插入框架

    ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。

  20. arXiv cs.CV27

    SpaTime:面向时空推理的流式视觉语言模型

    SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。

  21. arXiv cs.CV22

    视频多选评测中的帧相位与选项顺序:Stable Scores, Unstable Answers

    视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。

  22. arXiv cs.CV22

    RSJEV:用多模态大语言模型做判别式遥感场景分类

    针对遥感场景分类,研究者提出 RSJEV,将分类重构为候选类别条件下的多模态判别式决策过程,用 OnePass Decider 直接估计类别概率,省去自回归解码。在 UC Merced、AID、NWPU-RESISC45 三个基准上,RSJEV 性能优于代表性 CNN、Transformer、Mamba、CLIP 和 MLLM 方法,并以仅 0.8B 参数模型显著降低推理成本。代码将公开。

  23. arXiv cs.CV22

    BFG:面向隐私友好 AIoT 的图像比特流细粒度理解基础模型

    研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。

  24. arXiv cs.CV17

    用 Stevens 幂律检验 GPT-5.5 的图像可视化读取能力

    研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。

  25. arXiv cs.CV22

    数字孪生驱动的 Real2Sim2Real:通过配对驾驶场景重建实现模拟器条件生成

    数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。

  26. arXiv cs.CV12

    EventNet:用 2D 关键点检测乒乓球视频事件

    EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。