跳到正文
arXiv cs.CL· Radha Gulhane, Quentin Anthony, Beren Millidge·· 4 小时前AI 评分24

MoE 预训练中的专家耦合:用相关放置与 Token 重排降低 All-to-All 开销

Expert Coupling in MoE Pretraining: Reducing All-to-All Overhead with Correlated Placement and Token Shuffling

AI 导读

MoE 预训练中路由器在早期就已学会以相关模式分配 token,研究者据此提出相关专家放置与 token 重排两种方法,将常被同时选中的专家放到同一 GPU,并让每个 token 只向每个 GPU 发送一次,最多减少 58% 的 dispatch 行。

来源:arXiv cs.CL · arxiv.org