arXiv cs.LG· Bolian Li, Ting-Yao Hu, Cheng-Yu Hsieh, Sanjoy Chowdhury, Oncel Tuzel, Raviteja Vemulapalli·· 5 小时前AI 评分24
为智能体强化学习构建 MoE 专家选择结构
Structuring MoE Expert Selection for Agentic Reinforcement Learning
AI 导读
研究揭示现成 MoE 模型在智能体轨迹中已存在专家选择专门化结构:执行语义相似操作(如 READ、UPDATE)的轮次之间专家路由重叠度更高。标准 RL 算法忽略这一结构,导致训练中 MoE 路由失控,限制任务性能与推理效率。
来源:arXiv cs.LG · arxiv.org