跳到正文
arXiv cs.LG· Morgan Byrd, Jacob Blevins, Maks Sorokin, Robert Wright, Sehoon Ha·· 9 小时前AI 评分22

奖励即观测:学习基于奖励的策略以实现快速适应

Reward as Observation: Learning Reward-Based Policies for Rapid Adaptation

AI 导读

研究者提出一种仅以奖励和动作为条件的奖励策略,可在观测空间完全不同的源环境与目标环境之间实现零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练后,可零样本迁移到不同配色、3D 渲染以及 Habitat-Sim 中的 Stretch 机器人导航任务。基于奖励的策略还能进一步引导目标环境中基于观测的策略训练。

来源:arXiv cs.LG · arxiv.org