研究:on-policy蒸馏只传技能不传知识
热点事件持续更新
研究:on-policy蒸馏只传技能不传知识
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一项受控合成框架研究显示,采用 reverse-KL 的 On-Policy Distillation(OPD)能跨未见推理结构稳定迁移组合技能,但几乎不迁移事实知识。研究者 Yixuan Tang 与 Yi Yang 据此称,on-policy 蒸馏不会扩展模型的参数化知识,而是教模型组织和组合它已经掌握的知识。 这一结论区分了蒸馏的两种效果:可迁移的是技能,即对已有知识的组织与组合方式;事实知识本身则不会通过该方式进入模型。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
研究揭示 On-Policy Distillation 只教新技能不传新知识报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CL研究揭示 On-Policy Distillation 只教新技能不传新知识
一项受控合成框架研究显示,reverse-KL 的 On-Policy Distillation(OPD)能跨未见推理结构稳定迁移组合技能,但几乎不迁移事实知识。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。