DRIVE:多样性驱动RL微调提升VLA泛化
热点事件持续更新
DRIVE:多样性驱动RL微调提升VLA泛化
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究者提出 DRIVE,一种面向 VLA(视觉-语言-动作模型)泛化的强化学习微调方法,将成功行为的多样性转化为显式的 RL 目标:对轨迹进行分组对齐,并基于相对行为多样性构建成功条件内在奖励。 在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 三个基准上,DRIVE 使 π₀ 和 π₀.₅ 的平均 OOD(分布外)性能较原始 RL 微调分别提升 5.3 分和 2.0 分。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
DRIVE:面向 VLA 泛化的多样性驱动 RL 微调方法报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LGDRIVE:面向 VLA 泛化的多样性驱动 RL 微调方法
研究者提出 DRIVE,一种将成功行为多样性转化为显式 RL 目标的 VLA 微调方法,通过分组对齐轨迹并基于相对行为多样性构建成功条件内在奖励。在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 上,DRIVE 将 π₀ 和 π₀.₅ 的平均 OOD 性能较原始 RL 微调分别提升 5.3 分和 2.0 分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。