跳到正文
热点事件观察中

SF-MOPD多教师在线蒸馏方法提出

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Xiaofei Yin等作者提出慢-快多教师在线策略蒸馏方法(SF-MOPD),用于缓解多教师蒸馏中的能力干扰。该方法将学生模型的指数移动平均作为“慢模型”能力参考,在log-probability空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。 作者称,实验显示SF-MOPD在多个模型规模上缓解能力干扰、增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版MOPD。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.LG
    SF-MOPD:慢-快多教师在线策略蒸馏如何缓解能力干扰

    研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。