研究:MoE在重复数据下比稠密模型更易过拟合
热点事件持续更新
研究:MoE在重复数据下比稠密模型更易过拟合
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一项 arXiv 研究对比 80M 至 1B 激活参数(8.5B 总量)的模型后发现,混合专家模型(MoE)在训练数据重复时性能退化比稠密模型更快,且稀疏度越高越严重:80M 稠密模型重复 8 倍仍几乎无损,MoE 在重复 4 倍时就开始受损,重复 32 倍后性能反而不如稠密模型。 研究称,强掩码类正则化可让 MoE 在数据重复超过 64 次时仍优于稠密模型,但没有任何方法能追平使用全唯一数据的训练效果。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
数据稀缺与模型稀疏:MoE 在重复数据上更易过拟合报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CL数据稀缺与模型稀疏:MoE 在重复数据上更易过拟合
研究对比 80M 至 1B 激活参数(8.5B 总量)的模型发现,MoE 在数据重复时退化比稠密模型更快,且稀疏度越高越严重:80M 稠密模型重复 8x 仍几乎无损,MoE 在 4x 就开始受损,32x 后性能反而不如稠密模型。强掩码类正则化可让 MoE 在重复超 64 次时仍优于稠密模型,但没有任何方法能追平全唯一数据的训练效果。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。