跳到正文
arXiv cs.CV· Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo·· 4 小时前AI 评分30

Tri-Prompting:统一控制场景、主体与运动的视频扩散模型

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

AI 导读

Tri-Prompting 是一个视频扩散框架,通过首帧场景图、3D 多视角主体参考和运动驱动信号三类提示词,统一控制场景布局、主体身份与相机/主体运动。它用 XYZ 跟踪点处理可见背景运动、低分辨率 RGB 代理表示前景姿态,并在推理时通过 ControlNet scale schedule 平衡运动可控性与视觉真实感。

来源:arXiv cs.CV · arxiv.org