跳到正文
arXiv cs.LG· Iris Xu, Sunshine Jiang, John Marangola, Pulkit Agrawal, Zhang-Wei Hong·· 5 小时前AI 评分30

Learning from Hindsight:用失败轨迹提升 VLA 强化学习样本效率

Learning from Hindsight for VLA Reinforcement Learning

AI 导读

研究者提出 Learning from Hindsight(LfH),用预训练视觉语言模型为失败的 rollout 重新标注其实际完成的行为,并将这些辅助任务与目标指令任务联合训练 VLA 策略。

来源:arXiv cs.LG · arxiv.org