arXiv cs.CL· Ju-Chieh Chou, Jiawei Zhou, Karen Livescu·· 9 小时前AI 评分22
语音-文本语言模型的生成模态差距如何量化?SLT 2026 研究给出统一评测
Quantifying the Generation Modality Gap in Speech-Text Language Models
AI 导读
一项被 SLT 2026 接收的研究构建了统一生成式评测套件,在匹配数据分布与生成设置下对比纯语音、纯文本和语音-文本语言模型。结果显示联合语音-文本建模显著提升语义连贯性,但音素级指标变化有限,说话人相似度与预测质量反而更低,情感分布指标则有所改善。相比更大规模的纯语音模型,该语音-文本模型在基于转写的语义连贯性上缩小了大部分规模差距。
来源:arXiv cs.CL · arxiv.org