跳到正文
热点事件持续更新

CARES 合成基准评测音频语言模型

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者发布 CARES 合成基准,用于评测音频语言模型能否理解说话人对声音的反应。该语料库包含 10,000 个双说话人场景,以“说话人可听见地反应”定义声音显著性,对话由语言模型生成。 研究者在识别场景、标注声音和分类反应三项任务上评测了六个音频语言模型,结论是这些模型能听到声音,却捕捉不到说话人对声音的反应。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    CARES:一个受控的说话者对声音反应合成基准

    研究者构建了 CARES 语料库,包含 10,000 个双说话人场景,用"说话人可听见地反应"这一规则定义声音显著性,并由语言模型生成对话。他们随后在识别场景、标注声音和分类反应三项任务上评测了六个音频语言模型,结果显示这些模型能听到声音,却捕捉不到说话人对声音的反应。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。