Latent-MOPD:LLM多教师在线蒸馏新方法
热点事件观察中
Latent-MOPD:LLM多教师在线蒸馏新方法
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Zhengyu Fang 等作者提出 Latent-MOPD,一种面向大语言模型的表征级多教师同策略蒸馏(OPD)方法。该方法同时利用各教师的预测结果和生成这些预测所用的隐藏状态,无需额外训练教师。作者称,这是首个面向 LLM 的表征级多教师 OPD 方法。 在同家族教师设置下,Latent-MOPD 在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均三类基线;当参数量与各教师相同时,多数基准上超过单基准最佳教师。在跨家族教师设置下,该方法也在全部基准上超过单通道基线。
AI 根据报道生成 · 14 小时前更新
最新进展10月5日 12:00
Latent-MOPD:面向 LLM 的潜在多教师同策略蒸馏报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv cs.LGLatent-MOPD:面向 LLM 的潜在多教师同策略蒸馏
Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。