跳到正文
arXiv cs.CV· Anirudh Praveen, Koteswar Rao Jerripothula, Pratik Joshi, Aveen Dayal, Neela Sawant·· 3 小时前AI 评分22

基于复值融合的开放词汇音视频事件定位

Open-Vocabulary Audio-Visual Event Localization via Complex-Valued Fusion

AI 导读

研究提出用复值神经网络(CVNN)融合音视频相似度,实现开放词汇音视频事件定位(OV-AVEL)。视觉模态以 iHSV 虚部、音频模态以 CycleGAN 转换的相位频谱图作为伴随流,仅训练时序注意力模块与融合 CVNN,编码器保持冻结。

来源:arXiv cs.CV · arxiv.org