跳到正文
arXiv cs.AI· Jianglin Qiao, Siyi Hu, Thien Hoang Nguyen, Zehong Cao, Salah Sukkarieh·· 10 小时前AI 评分19

交错参与下的多智能体强化学习:SPL 训练增强方法

Cooperating with Future Collaborators: Multi-Agent RL under Staggered Participation

AI 导读

研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。

来源:arXiv cs.AI · arxiv.org