跳到正文
arXiv cs.LG· Shangzhe Li, Weitong Zhang·· 3 小时前AI 评分20

从离线到在线:通用函数逼近下的可证明高效价值自适应

Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation

AI 导读

研究在通用函数逼近下离线到在线强化学习的价值自适应问题,证明即使预训练 Q 函数接近最优 Q*,在某些困难实例上在线自适应效率也无法超过纯在线 RL。提出 O2O-LSVI 算法,在离线预训练价值函数的新结构条件下具有问题相关样本复杂度,可证明优于纯在线 RL,神经网络实验验证了其实际有效性。

来源:arXiv cs.LG · arxiv.org