arXiv cs.CV· Anirudh Praveen, Koteswar Rao Jerripothula, Pratik Joshi, Aveen Dayal, Neela Sawant·· 3 小时前AI 评分22
基于复值融合的开放词汇音视频事件定位
Open-Vocabulary Audio-Visual Event Localization via Complex-Valued Fusion
AI 导读
研究提出用复值神经网络(CVNN)融合音视频相似度,实现开放词汇音视频事件定位(OV-AVEL)。视觉模态以 iHSV 虚部、音频模态以 CycleGAN 转换的相位频谱图作为伴随流,仅训练时序注意力模块与融合 CVNN,编码器保持冻结。
来源:arXiv cs.CV · arxiv.org