arXiv stat.ML· Amirparsa Bahrami, Oliver Mortensen, Mohammad Sadegh Talebi·· 5 小时前AI 评分13
递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析
Near-Optimal Sample Complexity for Recursive Entropic Risk Reinforcement Learning with a Generative Model
AI 导读
针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。
来源:arXiv stat.ML · arxiv.org