跳到正文
arXiv cs.LG· Valliappan Chidambaram Adaikkappan, Sai Rajeswar, Pietro Mazzaglia, David Meger·· 9 小时前AI 评分22

MSPR:面向目标条件强化学习的多尺度预测表征

MSPR: Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning

AI 导读

针对离线目标条件强化学习(GCRL)在稀疏奖励下编码器易学到与目标无关特征、导致策略学习不稳定的问题,研究者提出 MSPR 框架,通过多尺度预测监督在隐空间中强化目标导向对齐。该方法在视觉与状态任务上均取得强劲表现,并在具有挑战性的真实数据条件下保持 SOTA 性能。

来源:arXiv cs.LG · arxiv.org