跳到正文
热点事件持续更新

多链MDP平均奖励分层分解RL算法提出

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Huizhen Yu 与 Isaiah Heidt 提出一种面向多链 MDP 的平均奖励强化学习算法,用于求解最优策略。该算法基于异步值迭代,除 MDP 的转移图外无需模型知识,并利用 Bather 分解将状态空间分层划分为通信子系统与瞬态状态。 该研究以预印本形式发布于 arXiv cs.LG,作者称算法无需转移图之外的模型信息,但报道未给出实验验证或性能对比结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    面向多链 MDP 的平均奖励强化学习:一种分层分解方法

    研究提出一种基于异步值迭代的强化学习算法,用于求解平均奖励多链 MDP 的最优策略,除转移图外无需模型知识,并利用 Bather 分解将状态空间划分为通信子系统与瞬态状态。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。