跳到正文
arXiv cs.LG· Lijun Bo, Yijie Huang, Chenhao Lu·· 6 小时前AI 评分12

基于确定性策略梯度的超立方体状态空间边界感知强化学习

Boundary-aware Reinforcement Learning for Hypercube State Spaces via Deterministic Policy Gradient

AI 导读

研究者提出连续时间确定性策略梯度框架,用于状态受超立方体上受控反射随机微分方程支配的强化学习,建立了值函数与 Neumann Bellman 方程的联系,并推导出确定性策略梯度公式。

来源:arXiv cs.LG · arxiv.org