arXiv cs.CL· Seymanur Akti, Alexander Waibel·· 5 小时前AI 评分23
基于可控风格嵌入的零样本 Lombard 语音合成
Zero-Shot Lombard Speech Synthesis with Controllable Style Embeddings
AI 导读
研究团队扩展 F5-TTS,提出一种无需 Lombard 专用训练数据的可控 TTS 系统,可零样本合成 Lombard 风格语音。该方法通过可学习的风格嵌入并用 PCA 分析其隐空间,找到与 Lombard 属性相关的方向,从而对发声力度和清晰度实现可解释控制。实验显示该方法在保持说话人身份与自然度的同时提升了噪声环境下的可懂度,并可泛化到未见过的说话人。
来源:arXiv cs.CL · arxiv.org