跳到正文
今天10月7日周三32 条
  1. arXiv cs.CV27

    ChronoWorld:用时空线索与几何反射实现相机可控的一致 4D 世界生成

    ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。

  2. arXiv cs.CV24

    TripleFlow:无需训练的视频对象移除,桥接残差编辑与原生生成

    TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。

  3. arXiv cs.CV22

    基于轨迹对齐字形渲染的视频文本编辑方法,在 VTEdit 基准上实现 0.9408 句子准确率

    研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。

  4. arXiv cs.CV22

    Latent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别

    研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。

  5. arXiv cs.CV27

    基于运动的 AI 生成视频检测器存在数据集偏差与捷径学习

    研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。

  6. arXiv cs.CV30

    视频世界模型的物理一致性基准:World Models' Last Exam in Physics

    研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。

  7. arXiv cs.CV26

    ALIVE:面向首帧引导视频编辑的交互对齐物体插入框架

    ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。

  8. arXiv cs.CV27

    SpaTime:面向时空推理的流式视觉语言模型

    SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。

  9. arXiv cs.CV22

    视频多选评测中的帧相位与选项顺序:Stable Scores, Unstable Answers

    视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。

  10. arXiv cs.CV12

    EventNet:用 2D 关键点检测乒乓球视频事件

    EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。

  11. arXiv cs.CV31

    TSRN-RTVD:实时视频去模糊系统

    TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。

  12. arXiv cs.CV22

    TF-PRVR:免训练的部分相关视频检索框架

    TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。

  13. arXiv cs.CV12

    基于深度学习的板球非法投球动作检测

    研究提出一种基于计算机视觉的深度学习方法,用于在板球比赛中实时检测非法投球动作。系统从投球视频中提取肩部帧和出手帧,分析两帧间投球手臂角度变化,若角度差超过预设阈值(如 15 度)则判定为疑似非法投球。团队构建了包含 11 名男性投手、62 段视频的数据集,系统取得较高真阳性率,但数据集以右手常规动作为主,仍需在更多样环境和更大数据集上验证。

  14. arXiv cs.LG31

    Online Neural Space Time Memory:解耦记忆更新频率的实时动态新视角合成

    针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。

  15. arXiv cs.LG22

    冻结的 VideoLLM 是否已编码证据就绪信号?Readiness Gating 提升回答时机准确率

    研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。

  16. arXiv cs.LG24

    什么是 Fréchet 距离?一种方向性分解方法

    研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。

  17. arXiv cs.AI24

    用多模态 LLM 实时生成游戏解说:基于停顿感知的解码方法

    研究提出两种基于提示的解码策略实现实时游戏视频解说生成:固定间隔解码与动态间隔解码,后者根据上一句解说的预估时长调整下一次预测时机,无需微调即可实现停顿感知生成。在日语和英语的赛车与格斗游戏数据集上,动态间隔解码生成的解说在时间与内容上更贴近人类解说。团队同时开源了多语言基准数据集、训练模型与实现代码。

  18. arXiv cs.AI29

    WorldSonus:为世界模型带来实时空间音效

    WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音效。它采用流式因果自回归扩散架构,实时因子低至 0.41,并通过以音频为中心的描述管线与分块提示词调度实现生成过程中的动态声音控制,同时利用立体声与 ambisonic 数据实现空间对齐。实验显示其在声学质量与空间对齐上匹配或超越当前最优的双向模型。

  19. arXiv cs.AI26

    基于控制的动态优化实现多样化运动定制

    针对视频生成中运动定制的内容泄漏问题,研究者提出 Control-based Motion Customization(CMC)训练框架,用随机最优控制(SOC)引导生成动态朝向目标运动、避免向参考视频坍缩。该方法去除显式奖励并引入仅作用于生成早期阶段的时间步自适应运动代价,训练速度提升 2.5 倍,在缓解内容泄漏的同时保持运动保真度与基座模型的多样性。

  20. arXiv cs.AI22

    SUTURE:用 rollout 组结构改进视频时序定位验证器

    SUTURE 提出一种基于 rollout 组结构的视频时序定位验证方法,将验证条件建立在整组 rollout 上,并证明其可精确分解为标准 IoU 项与由 rollout 组决定的协方差修正项。在五个时序定位 benchmark 上,SUTURE 在所有报告的 IoU 阈值下均提升定位性能,其训练策略在推理轨迹中也表现出更少的视频起点锚定。

10月5日周一
  1. arXiv cs.CV23

    Spatial Memory Intelligence:用理解模型为世界模型赋予长期空间记忆

    研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架。SMI 包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项协同原子操作,在多个基线、benchmark 和世界模型骨干上实现了记忆稀疏度、生成稳定性与空间一致性的全面提升。

  2. arXiv cs.CV22

    SymRegFlow:面向视频世界模型的对称正则化流匹配

    SymRegFlow 是一个对称正则化流匹配框架,可在无新视角 RGB 真值监督的情况下,实现连续视角下的多视角一致视频生成。该方法通过几何变换将源视图转为带噪锚点,结合掩码双锚点监督与跨锚点去噪输出一致性来抑制锚点误差,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优解。

  3. arXiv cs.CV24

    TRAC:面向高效自回归视频生成的轨迹感知复用与自适应校正框架

    TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。

9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,生成带唇形同步和自然表情的动态视觉形象。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。