跳到正文
热点事件持续更新

研究:MoE在重复数据下比稠密模型更易过拟合

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项 arXiv 研究对比 80M 至 1B 激活参数(8.5B 总量)的模型后发现,混合专家模型(MoE)在训练数据重复时性能退化比稠密模型更快,且稀疏度越高越严重:80M 稠密模型重复 8 倍仍几乎无损,MoE 在重复 4 倍时就开始受损,重复 32 倍后性能反而不如稠密模型。 研究称,强掩码类正则化可让 MoE 在数据重复超过 64 次时仍优于稠密模型,但没有任何方法能追平使用全唯一数据的训练效果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    数据稀缺与模型稀疏:MoE 在重复数据上更易过拟合

    研究对比 80M 至 1B 激活参数(8.5B 总量)的模型发现,MoE 在数据重复时退化比稠密模型更快,且稀疏度越高越严重:80M 稠密模型重复 8x 仍几乎无损,MoE 在 4x 就开始受损,32x 后性能反而不如稠密模型。强掩码类正则化可让 MoE 在重复超 64 次时仍优于稠密模型,但没有任何方法能追平全唯一数据的训练效果。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。