arXiv cs.LG· Valliappan Chidambaram Adaikkappan, Sai Rajeswar, Pietro Mazzaglia, David Meger·· 5 小时前AI 评分22
MSPR:面向目标条件强化学习的多尺度预测表征
MSPR: Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning
AI 导读
针对离线目标条件强化学习(GCRL)在稀疏奖励下编码器易学到与目标无关特征、导致策略学习不稳定的问题,研究者提出 MSPR 框架,通过多尺度预测监督在隐空间中强化目标导向对齐。该方法在视觉与状态任务上均取得强劲表现,并在具有挑战性的真实数据条件下保持 SOTA 性能。
来源:arXiv cs.LG · arxiv.org