跳到正文
热点事件持续更新

研究称提高输出投影Adam epsilon可缓解遗忘

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项 arXiv 研究分析大语言模型持续预训练中的灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入,由语料词汇缺失而非训练模式决定。 作者 Jonghyun Han 等人据此提出,在训练期间仅对输出投影提高 Adam 优化器的 epsilon。研究称,在 160M 至 12B 参数、四个模型家族的八种设置中,该干预消除 39.4% 至 67.9% 的遗忘,且不损害目标学习。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    研究揭示 LLM 灾难性遗忘集中于数据未覆盖 token 的输出嵌入,提出单行 Adam 优化器调整方案

    研究分析 LLM 持续预训练中的数据无关灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入,由语料词汇缺失而非训练模式决定。为此提出在训练期间仅对输出投影提高 Adam 的 epsilon,在 160M 至 12B 参数、四个模型家族的八种设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。