跳到正文
热点事件观察中

Latent-MOPD:LLM多教师在线蒸馏新方法

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Zhengyu Fang 等作者提出 Latent-MOPD,一种面向大语言模型的表征级多教师同策略蒸馏(OPD)方法。该方法同时利用各教师的预测结果和生成这些预测所用的隐藏状态,无需额外训练教师。作者称,这是首个面向 LLM 的表征级多教师 OPD 方法。 在同家族教师设置下,Latent-MOPD 在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均三类基线;当参数量与各教师相同时,多数基准上超过单基准最佳教师。在跨家族教师设置下,该方法也在全部基准上超过单通道基线。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.LG
    Latent-MOPD:面向 LLM 的潜在多教师同策略蒸馏

    Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。