arXiv cs.CL· Mengzhe Geng·· 4 小时前AI 评分22
生成式音频调用对已知任务音频 LLM 评测的增量价值审计
Auditing generative audio calls for known-task audio-llm evaluation
AI 导读
研究用匹配选择器审计生成式音频调用在已知任务音频 LLM 评测中的增量价值。在 VocalSound 上,仅转录准确率为 0.296,监督 CLAP 与 WavLM 对照分别达 0.850 和 0.854;完整选择器在 12.5% 调用率下为 0.925,匹配的无调用选择器为 0.921,差异 0.004(95% CI [-0.025, 0.033])。
来源:arXiv cs.CL · arxiv.org