arXiv cs.CL· Yixuan Tang, Yi Yang·· 4 小时前AI 评分36
研究揭示 On-Policy Distillation 只教新技能不传新知识
On-Policy Distillation Teaches New Skills but Not New Knowledge
AI 导读
一项受控合成框架研究显示,reverse-KL 的 On-Policy Distillation(OPD)能跨未见推理结构稳定迁移组合技能,但几乎不迁移事实知识。
来源:arXiv cs.CL · arxiv.org