跳到正文
arXiv cs.LG· Haoru Li, Jinmei Liu, Zhiyong Wang, Xiaoming Li, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang·· 6 小时前AI 评分22

DRIVE:面向 VLA 泛化的多样性驱动 RL 微调方法

Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization

AI 导读

研究者提出 DRIVE,一种将成功行为多样性转化为显式 RL 目标的 VLA 微调方法,通过分组对齐轨迹并基于相对行为多样性构建成功条件内在奖励。在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 上,DRIVE 将 π₀ 和 π₀.₅ 的平均 OOD 性能较原始 RL 微调分别提升 5.3 分和 2.0 分。

来源:arXiv cs.LG · arxiv.org