跳到正文
热点事件持续更新

GIVE-KWS 提出视觉证据门控注入方法

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Ming-Hsiang Hu 等作者提出 GIVE-KWS,一种噪声鲁棒的示例查询关键词识别方法。其融合阶段 GIVE 通过门控交叉注意力,用唇动视觉证据对查询音频进行条件化。 作者称,在 -10 dB 噪声下,该方法将未见关键词的等错误率(EER)较基准系统降低 72.9%,平均降低 62.8%。研究还称,视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式;在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0–9.3 dB 的有效信噪比增益。

AI 根据报道生成 · 7 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CL
    GIVE-KWS:用门控视觉证据注入实现噪声鲁棒的示例查询关键词识别

    GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 较基准系统降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式。在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0-9.3 dB 的有效 SNR 增益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。