跳到正文
热点事件观察中

研究:SFT比RFT更易遗忘的机制差异

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

一项 arXiv 研究用可解析的线性-softmax 策略,对比了分类任务中监督微调(SFT)与强化微调(RFT)的更新机制。作者 Haodong Liang 等称,在相同策略和提示词下,两者的语义更新平行,但风格动态不同:RFT 用精确策略梯度可保持类内风格对称,SFT 在非均匀教师下则会产生偏离轴的风格漂移。 该研究称,这一漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。这为“教师示范语义全部正确时 SFT 仍比 RFT 遗忘更多”提供了一种机制解释。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv stat.ML
    SFT 与 RFT 在分类任务上的对比研究:学习风格,遗忘语义

    一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。