跳到正文
热点事件持续更新

研究揭示语言模型微调中的伪遗忘机制

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Vedant Palit等作者发表论文,研究语言模型微调时看似遗忘的知识为何往往仍被存储且可恢复,即“伪遗忘”。研究通过一个最小联想记忆模型复现该动态,认为共享结构的键、集中的新值和网络归一化三者共同作用:微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。 论文称,其目标是理解这种遗忘在何时不是灾难性的。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.LG
    语言模型微调中的伪遗忘机制:遗忘为何不总是灾难性的

    语言模型微调时看似遗忘的知识往往仍被存储且可恢复,这种现象被称为伪遗忘。研究通过一个最小联想记忆模型复现了该动态:共享结构的键、集中的新值和网络归一化三者共同作用,微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。