跳到正文
arXiv cs.CL· Atindra Jha, Margaret Li, Jure Leskovec, Percy Liang, Luke Zettlemoyer·· 4 小时前AI 评分33

数据稀缺与模型稀疏:MoE 在重复数据上更易过拟合

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

AI 导读

研究对比 80M 至 1B 激活参数(8.5B 总量)的模型发现,MoE 在数据重复时退化比稠密模型更快,且稀疏度越高越严重:80M 稠密模型重复 8x 仍几乎无损,MoE 在 4x 就开始受损,32x 后性能反而不如稠密模型。强掩码类正则化可让 MoE 在重复超 64 次时仍优于稠密模型,但没有任何方法能追平全唯一数据的训练效果。

来源:arXiv cs.CL · arxiv.org