研究称提高输出投影Adam epsilon可缓解遗忘
热点事件持续更新
研究称提高输出投影Adam epsilon可缓解遗忘
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一项 arXiv 研究分析大语言模型持续预训练中的灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入,由语料词汇缺失而非训练模式决定。 作者 Jonghyun Han 等人据此提出,在训练期间仅对输出投影提高 Adam 优化器的 epsilon。研究称,在 160M 至 12B 参数、四个模型家族的八种设置中,该干预消除 39.4% 至 67.9% 的遗忘,且不损害目标学习。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
研究揭示 LLM 灾难性遗忘集中于数据未覆盖 token 的输出嵌入,提出单行 Adam 优化器调整方案报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CL研究揭示 LLM 灾难性遗忘集中于数据未覆盖 token 的输出嵌入,提出单行 Adam 优化器调整方案
研究分析 LLM 持续预训练中的数据无关灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入,由语料词汇缺失而非训练模式决定。为此提出在训练期间仅对输出投影提高 Adam 的 epsilon,在 160M 至 12B 参数、四个模型家族的八种设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。