跳到正文
arXiv cs.LG· Fengxu Liu, Siwei Wang, Gal Dalal, Shie Mannor, Yihan Du·· 9 小时前AI 评分18

线性函数逼近下基于分段奖励反馈的强化学习

Reinforcement Learning with Segment Reward Feedback under Linear Function Approximation

AI 导读

研究在线性函数逼近下用分段奖励反馈替代逐状态-动作奖励的强化学习。针对等长分段,作者提出 $\bitssegd$、$\edlinucbsegd$ 及统一 $\seglsvits$ 框架,并给出近匹配下界;二元反馈下增加分段数可指数级降低 regret,而求和反馈下分段粒度影响不大。允许任意分段的 $\uneqsegbitsd$ 表明等长分段性能最佳。

来源:arXiv cs.LG · arxiv.org