跳到正文
arXiv cs.AI· Zipeng Wang, Xinpeng Dong, Yuefan Wang, Pingchen Lu, Xian Wei, Kun Kuang, Fei Wu, Zhongxiang Dai, Min Zhang·· 3 小时前AI 评分24

MetaOPD:用元学习为在线策略蒸馏做 token 加权

MetaOPD: Meta-Learned Token Weighting for On-Policy Distillation

AI 导读

MetaOPD 是一个双层优化框架,同时学习学生模型和一个轻量 token 加权网络,内层用加权在线策略蒸馏(OPD)更新学生,外层依据虚拟更新后在参考解上的验证损失优化加权网络,使预测信号到 token 权重的映射随学生一同演化。

来源:arXiv cs.AI · arxiv.org