跳到正文
arXiv cs.CL· Ryo Magoshi, Shinsuke Sakai, Tatsuya Kawahara·· 4 小时前AI 评分22

音素引导初始化:提升低资源场景下 LLM 语音识别性能

Phoneme-Guided Initialization for LLM-based Speech Recognition

AI 导读

研究者提出"音素引导初始化"方法,通过先在语音转音素(S2P)任务上预训练音频编码器、在大语言模型上预训练音素转字素(P2G)任务,再端到端微调完整模型,从而将级联式 S2P-P2G 流程的优势引入端到端框架。

来源:arXiv cs.CL · arxiv.org