跳到正文
arXiv cs.AI· Nick Leenders, Roy Lindelauf, Joost van Oijen, Boris Cule·· 3 小时前AI 评分22

基于约束命令条件强化学习与 Bandit 策略选择的 MicroRTS 智能体

Constrained Command-Conditioned Reinforcement Learning with Bandit Strategy Selection in Real-Time Strategy Games

AI 导读

研究者为 MicroRTS 提出一种"策略器-执行器"架构:约束命令条件的 PPO 执行器负责单位级操作,Thompson-sampling bandit 策略器根据游戏内观测估计对手策略并选择命令元组。

来源:arXiv cs.AI · arxiv.org