arXiv cs.CV· Shulian Zhang, Xiangyu Shu, Wenbo Li, Jian Chen, Yong Guo·· 5 小时前AI 评分22
基于轨迹对齐字形渲染的视频文本编辑方法,在 VTEdit 基准上实现 0.9408 句子准确率
Enhanced Video Text Editing with Trajectory-Aligned Glyph Rendering
AI 导读
研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。
来源:arXiv cs.CV · arxiv.org