跳到正文
arXiv cs.LG· Jingyuan Huang, Zuming Huang, Yucheng Shi, Zhongzhi Li, Xiaoming Zhai, Wei Chu, Ninghao Liu·· 6 小时前AI 评分22

Train4Merge:RL 与 SFT 教师用于 OPD 模型合并的受控单教师对比研究

Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging

AI 导读

研究对比了 SFT 与 RL 两种训练算法产出的教师模型在 on-policy distillation(OPD)模型合并中的效果,教师与学生均基于 Qwen3.5-9B 初始化。

来源:arXiv cs.LG · arxiv.org