跳到正文
热点事件持续更新

递归熵风险RL样本复杂度近最优分析

1 篇报道1 个报道来源4 小时前更新

先了解这件事

报道摘要

针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。

摘自 arXiv stat.ML

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv stat.ML
    递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析

    针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。