递归熵风险RL样本复杂度近最优分析
热点事件持续更新
递归熵风险RL样本复杂度近最优分析
1 篇报道1 个报道来源9 小时前更新
先了解这件事
报道摘要
针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。
摘自 arXiv stat.ML
最新进展10月7日 12:00
递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv stat.ML递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析
针对递归熵风险偏好(风险参数 β≠0)下的有限折扣 MDP,研究者对基于生成模型的风险敏感 Q 值迭代(MB-RS-QVI)进行了精细化分析,给出了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。