跳到正文
arXiv stat.ML· Amirparsa Bahrami, Oliver Mortensen, Mohammad Sadegh Talebi·· 10 小时前AI 评分13

递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析

Near-Optimal Sample Complexity for Recursive Entropic Risk Reinforcement Learning with a Generative Model

AI 导读

针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。

来源:arXiv stat.ML · arxiv.org