arXiv cs.LG· Kaushik Pendiyala, Haris Zia, Trevin Lee, Timothy Legge, Alejandro J. De Leon, Zihan Zhao, Aaron Wang, Abhijith Gandrakota, Jennifer Ngadiuba, Richard Cavanaugh, Javier Duarte·· 6 小时前AI 评分22
MoE Particle Transformer 在 JetClass-II 上的条件容量与路由研究
Conditional Capacity and Routing in Mixture-of-Experts Particle Transformers
AI 导读
研究在 188 类 JetClass-II 上对比稠密与 MoE Particle Transformer,发现避免 token dropping 时 top-1 MoE 在标称前向计算几乎不变的情况下优于稠密基线,继续增加存储专家数量带来的精度提升很小。每 token 激活多个专家可进一步提升预测性能,但计算成本更高。路由分析显示专家分配与粒子身份和运动学特征的关联并不随分类性能单调增强。
来源:arXiv cs.LG · arxiv.org