跳到正文
arXiv cs.CL· Siyan Zhao, Yonggan Fu, Jindong Jiang, Shih-Yang Liu, Song Bian, Byung-Kwan Lee, Sharath Turuvekere Sreenivas, Wenliang Dai, Hanrong Ye, Aditya Grover, Pavlo Molchanov·· 3 小时前AI 评分22

何时需要 On-Policy Distillation?用离线学生 rollout 蒸馏往往更好

When Do We Need On-Policy Distillation? Distilling on Offline Student Rollouts Is Often Better

AI 导读

研究对比了 on-policy distillation(OPD)与 Semi-OPD——后者用初始学生模型生成的离线 rollout 进行蒸馏。在 17 组 1.5B 至 235B 参数的师生模型对上,Semi-OPD 在 14 组中优于 OPD,最高提升 13.6% 准确率并带来 11.4 倍训练加速。

来源:arXiv cs.CL · arxiv.org