跳到正文
热点事件持续更新

MetaOPD:元学习令牌加权用于在线策略蒸馏

1 篇报道1 个报道来源2 小时前更新

先了解这件事

报道摘要

MetaOPD 是一个双层优化框架,同时学习学生模型和一个轻量 token 加权网络,内层用加权在线策略蒸馏(OPD)更新学生,外层依据虚拟更新后在参考解上的验证损失优化加权网络,使预测信号到 token 权重的映射随学生一同演化。

摘自 arXiv cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.AI
    MetaOPD:用元学习为在线策略蒸馏做 token 加权

    MetaOPD 是一个双层优化框架,同时学习学生模型和一个轻量 token 加权网络,内层用加权在线策略蒸馏(OPD)更新学生,外层依据虚拟更新后在参考解上的验证损失优化加权网络,使预测信号到 token 权重的映射随学生一同演化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。