arXiv cs.CL· Zirui Li, Lauri Juvela, Mikko Kurimo·· 9 小时前AI 评分22
基于音素后验图的芬兰语语音发音编辑:PPG2Speech 模型
Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams
AI 导读
研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。
来源:arXiv cs.CL · arxiv.org