跳到正文
热点事件持续更新

研究:on-policy蒸馏只传技能不传知识

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项受控合成框架研究显示,采用 reverse-KL 的 On-Policy Distillation(OPD)能跨未见推理结构稳定迁移组合技能,但几乎不迁移事实知识。研究者 Yixuan Tang 与 Yi Yang 据此称,on-policy 蒸馏不会扩展模型的参数化知识,而是教模型组织和组合它已经掌握的知识。 这一结论区分了蒸馏的两种效果:可迁移的是技能,即对已有知识的组织与组合方式;事实知识本身则不会通过该方式进入模型。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    研究揭示 On-Policy Distillation 只教新技能不传新知识

    一项受控合成框架研究显示,reverse-KL 的 On-Policy Distillation(OPD)能跨未见推理结构稳定迁移组合技能,但几乎不迁移事实知识。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。