跳到正文
arXiv cs.LG· Bolian Li, Ting-Yao Hu, Cheng-Yu Hsieh, Sanjoy Chowdhury, Oncel Tuzel, Raviteja Vemulapalli·· 5 小时前AI 评分24

为智能体强化学习构建 MoE 专家选择结构

Structuring MoE Expert Selection for Agentic Reinforcement Learning

AI 导读

研究揭示现成 MoE 模型在智能体轨迹中已存在专家选择专门化结构:执行语义相似操作(如 READ、UPDATE)的轮次之间专家路由重叠度更高。标准 RL 算法忽略这一结构,导致训练中 MoE 路由失控,限制任务性能与推理效率。

来源:arXiv cs.LG · arxiv.org