跳到正文
arXiv cs.LG· Marcel Gibier, Thomas Thebaud, Olivier Bo\"effard, Jean-Fran\c{c}ois Bonastre·· 6 小时前AI 评分17

CARES:一个受控的说话者对声音反应合成基准

CARES: A Controlled Synthetic Benchmark of Speaker Reactions to Sound

AI 导读

研究者构建了 CARES 语料库,包含 10,000 个双说话人场景,用"说话人可听见地反应"这一规则定义声音显著性,并由语言模型生成对话。他们随后在识别场景、标注声音和分类反应三项任务上评测了六个音频语言模型,结果显示这些模型能听到声音,却捕捉不到说话人对声音的反应。

来源:arXiv cs.LG · arxiv.org