ChronoWorld:用时空线索与几何反射实现相机可控的一致 4D 世界生成
ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。
ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。
CNP-Flow 是一个通过流反转学习条件源分布的时间生成流匹配框架,用条件噪声预测器(CNP)为每个时间条件生成各向同性高斯源,替代标准条件流匹配从标准高斯采样的做法。
TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。
SEGUE 是一个让流式视频生成器忠实执行中流提示词切换过渡的新框架:每次切换时由免训练规划器解析最新帧与提示词,写入带角色和时长的 segue prompts 后再交还用户提示词。
研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。
研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。
研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。
针对长视频中物体反复消失与重现的开放世界分割难题,研究者提出零样本、半在线、类别无关的 Savvy 系统与 OGA 评测套件。Savvy 结合模块化掩码发现、基于累积证据的延迟准入与轨迹整合来维护动态物体集合;OGA 支持多预测对应单一参考并保留预测 ID。
研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。
ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。
CtrlCache 是一个免训练的控制感知缓存框架,通过动作感知调度与刷新策略,将视频块标记为初始、过渡、转向或稳态,并在选定的去噪步骤复用 Transformer 残差,同时用频率混合历史先验引导利用低频结构。
SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。
RenderBench 是一个面向渲染到真实(render-to-real)视频迁移的基准,包含 12 个重建的真实场景,覆盖大规模室内环境与第一人称视角,含静态和动态设置。
EC-RAG 是一个免训练框架,先将视频切分为语义连贯的片段并链接成保留时序的事件链,再针对查询定位相关事件、聚合语音文本与视觉等多模态证据。它在 Video-MME、MLVU 和 LongVideoBench 上持续优于帧级检索基线,并可即插即用兼容现有 LVLM 主干,无需额外训练或依赖闭源模型。
FocusGate 是一种带门控的无注视先验集成方法,成员可弃权:逐帧门控读取散焦图的三个形状统计量,只选取估计器平均高于随机的帧,被拒帧精确退化为基线。在电影、体育和网页视频上,门控融合显著为正,无条件融合在体育上有害、在网页上无效。
视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。
HuC-VideoMAE 提出一种人体中心掩码方案,利用身体关键点和人体边界框区域,在合成人体运动数据集上自监督预训练视频 Transformer。
EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。
TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。
TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。
GSCV 提出一种利用标准视频编解码器的 Gaussian Splatting(GS)序列压缩方法,通过 Inter-PLAS 增强 GS 在 I 帧与 P 帧之间的帧间相关性,无需依赖追踪信息。
研究提出一种基于计算机视觉的深度学习方法,用于在板球比赛中实时检测非法投球动作。系统从投球视频中提取肩部帧和出手帧,分析两帧间投球手臂角度变化,若角度差超过预设阈值(如 15 度)则判定为疑似非法投球。团队构建了包含 11 名男性投手、62 段视频的数据集,系统取得较高真阳性率,但数据集以右手常规动作为主,仍需在更多样环境和更大数据集上验证。
研究将物体从冻结的 V-JEPA 2 预测器中隐藏,发现其预测对静止物体仅部分保留、对容器内物体完全丢失,运动物体在 0.3 秒内即消失(V-JEPA 自带 tube mask 下为 0.5 秒,ViT-H 在 90% 掩码率下可保留至 1.1 秒)。
针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。
研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。
研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。
研究提出两种基于提示的解码策略实现实时游戏视频解说生成:固定间隔解码与动态间隔解码,后者根据上一句解说的预估时长调整下一次预测时机,无需微调即可实现停顿感知生成。在日语和英语的赛车与格斗游戏数据集上,动态间隔解码生成的解说在时间与内容上更贴近人类解说。团队同时开源了多语言基准数据集、训练模型与实现代码。
一篇综述系统梳理了基于扩散模型的视频编辑技术,涵盖数学基础、图像域关键方法及按核心技术关联划分的视频编辑方法演化脉络。文章还探讨了基于点的编辑和姿态引导的人体视频编辑等新应用,并引入新基准 V2VBench 进行全面对比,最后总结了现存挑战与未来方向。
WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音效。它采用流式因果自回归扩散架构,实时因子低至 0.41,并通过以音频为中心的描述管线与分块提示词调度实现生成过程中的动态声音控制,同时利用立体声与 ambisonic 数据实现空间对齐。实验显示其在声学质量与空间对齐上匹配或超越当前最优的双向模型。
研究者提出面向自动驾驶视频的时空一致性对抗攻击(STCA),分模态扩展、空间攻击与 STCA 攻击三阶段,其中模态扩展用 caption 引导选帧、STCA 阶段用运动引导掩码破坏跨帧时序一致性。
针对视频生成中运动定制的内容泄漏问题,研究者提出 Control-based Motion Customization(CMC)训练框架,用随机最优控制(SOC)引导生成动态朝向目标运动、避免向参考视频坍缩。该方法去除显式奖励并引入仅作用于生成早期阶段的时间步自适应运动代价,训练速度提升 2.5 倍,在缓解内容泄漏的同时保持运动保真度与基座模型的多样性。
SUTURE 提出一种基于 rollout 组结构的视频时序定位验证方法,将验证条件建立在整组 rollout 上,并证明其可精确分解为标准 IoU 项与由 rollout 组决定的协方差修正项。在五个时序定位 benchmark 上,SUTURE 在所有报告的 IoU 阈值下均提升定位性能,其训练策略在推理轨迹中也表现出更少的视频起点锚定。
研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架。SMI 包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项协同原子操作,在多个基线、benchmark 和世界模型骨干上实现了记忆稀疏度、生成稳定性与空间一致性的全面提升。
SymRegFlow 是一个对称正则化流匹配框架,可在无新视角 RGB 真值监督的情况下,实现连续视角下的多视角一致视频生成。该方法通过几何变换将源视图转为带噪锚点,结合掩码双锚点监督与跨锚点去噪输出一致性来抑制锚点误差,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优解。
TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,生成带唇形同步和自然表情的动态视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。