跳到正文
arXiv cs.LG· Huizhen Yu, Isaiah Heidt·· 6 小时前AI 评分18

面向多链 MDP 的平均奖励强化学习:一种分层分解方法

Average-Reward Reinforcement Learning for Multichain MDPs: A Hierarchical Decomposition Approach

AI 导读

研究提出一种基于异步值迭代的强化学习算法,用于求解平均奖励多链 MDP 的最优策略,除转移图外无需模型知识,并利用 Bather 分解将状态空间划分为通信子系统与瞬态状态。

来源:arXiv cs.LG · arxiv.org