跳到正文
arXiv cs.LG· Hugo Malard, Gael Le Lan, Daniel Wong, David Lou Alon, Yi-Chiao Wu, Sanjeel Parekh·· 3 小时前AI 评分12

用条件流匹配(CFM)实现视觉引导的音频高亮

Conditional Flow Matching for Visually-Guided Acoustic Highlighting

AI 导读

针对视觉引导的音频高亮任务,研究者将其重构为生成问题并提出 Conditional Flow Matching(CFM)框架,以替代此前难以处理音频重混歧义的判别式模型。方法引入 rollout loss 惩罚最终步的轨迹漂移,并用一个在向量场回归前融合音视频线索的条件模块实现跨模态声源选择。定量与定性评估显示,该方法持续超越此前的 SOTA 判别式方法。

来源:arXiv cs.LG · arxiv.org