研究揭示语言模型微调中的伪遗忘机制
热点事件持续更新
研究揭示语言模型微调中的伪遗忘机制
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
Vedant Palit等作者发表论文,研究语言模型微调时看似遗忘的知识为何往往仍被存储且可恢复,即“伪遗忘”。研究通过一个最小联想记忆模型复现该动态,认为共享结构的键、集中的新值和网络归一化三者共同作用:微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。 论文称,其目标是理解这种遗忘在何时不是灾难性的。
AI 根据报道生成 · 8 小时前更新
最新进展10月7日 12:00
语言模型微调中的伪遗忘机制:遗忘为何不总是灾难性的报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.LG语言模型微调中的伪遗忘机制:遗忘为何不总是灾难性的
语言模型微调时看似遗忘的知识往往仍被存储且可恢复,这种现象被称为伪遗忘。研究通过一个最小联想记忆模型复现了该动态:共享结构的键、集中的新值和网络归一化三者共同作用,微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。