arXiv cs.CL· Jonghyun Han, Younghoon Song, Jongyoul Park·· 4 小时前AI 评分32
研究揭示 LLM 灾难性遗忘集中于数据未覆盖 token 的输出嵌入,提出单行 Adam 优化器调整方案
A Deafening Silence: Catastrophic Forgetting Lives in the Output Embeddings of Tokens the Data Never Speaks
AI 导读
研究分析 LLM 持续预训练中的数据无关灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入,由语料词汇缺失而非训练模式决定。为此提出在训练期间仅对输出投影提高 Adam 的 epsilon,在 160M 至 12B 参数、四个模型家族的八种设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习。
来源:arXiv cs.CL · arxiv.org