arXiv cs.LG· Iris Xu, Sunshine Jiang, John Marangola, Pulkit Agrawal, Zhang-Wei Hong·· 5 小时前AI 评分30
Learning from Hindsight:用失败轨迹提升 VLA 强化学习样本效率
Learning from Hindsight for VLA Reinforcement Learning
AI 导读
研究者提出 Learning from Hindsight(LfH),用预训练视觉语言模型为失败的 rollout 重新标注其实际完成的行为,并将这些辅助任务与目标指令任务联合训练 VLA 策略。
来源:arXiv cs.LG · arxiv.org