跳到正文
arXiv cs.CL· Yixuan Tang, Yi Yang·· 4 小时前AI 评分36

研究揭示 On-Policy Distillation 只教新技能不传新知识

On-Policy Distillation Teaches New Skills but Not New Knowledge

AI 导读

一项受控合成框架研究显示,reverse-KL 的 On-Policy Distillation(OPD)能跨未见推理结构稳定迁移组合技能,但几乎不迁移事实知识。

来源:arXiv cs.CL · arxiv.org