跳到正文
arXiv cs.LG· Kenan Tang, Andong Hua, Chengxuan Qian, Saket Tiwari, Yao Qin·· 3 小时前AI 评分31

SFT-as-Context:一种免训练方法缓解监督微调中的灾难性遗忘

SFT-as-Context Mitigates Forgetting in Supervised Fine-Tuning

AI 导读

研究者提出免训练方法 SFT-as-context,让父模型以 SFT 模型的回答为上下文来作答,从而在通过上下文学习获得微调能力的同时保留自身通用能力。在 19 组父-SFT 模型对和 11 个基准上,该方法在 AIME 2024 和 LiveCodeBench 上仅落后 SFT 模型 2.2 和 2.1 个百分点,通用能力平均与父模型差距在 2.2 个百分点以内。

来源:arXiv cs.LG · arxiv.org