研究:SFT比RFT更易遗忘的机制差异
热点事件观察中
研究:SFT比RFT更易遗忘的机制差异
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
一项 arXiv 研究用可解析的线性-softmax 策略,对比了分类任务中监督微调(SFT)与强化微调(RFT)的更新机制。作者 Haodong Liang 等称,在相同策略和提示词下,两者的语义更新平行,但风格动态不同:RFT 用精确策略梯度可保持类内风格对称,SFT 在非均匀教师下则会产生偏离轴的风格漂移。 该研究称,这一漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。这为“教师示范语义全部正确时 SFT 仍比 RFT 遗忘更多”提供了一种机制解释。
AI 根据报道生成 · 14 小时前更新
最新进展10月5日 12:00
SFT 与 RFT 在分类任务上的对比研究:学习风格,遗忘语义报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv stat.MLSFT 与 RFT 在分类任务上的对比研究:学习风格,遗忘语义
一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。