arXiv cs.AI· Xin Teng, Muxiao Li, Hongyi Wen·· 13 小时前AI 评分27
DRMoET:分布鲁棒混合专家(MoE)训练方法
Distributionally Robust Mixture-of-Experts Training
AI 导读
研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。
来源:arXiv cs.AI · arxiv.org