跳到正文
热点事件持续更新

DRIVE:多样性驱动RL微调提升VLA泛化

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者提出 DRIVE,一种面向 VLA(视觉-语言-动作模型)泛化的强化学习微调方法,将成功行为的多样性转化为显式的 RL 目标:对轨迹进行分组对齐,并基于相对行为多样性构建成功条件内在奖励。 在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 三个基准上,DRIVE 使 π₀ 和 π₀.₅ 的平均 OOD(分布外)性能较原始 RL 微调分别提升 5.3 分和 2.0 分。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    DRIVE:面向 VLA 泛化的多样性驱动 RL 微调方法

    研究者提出 DRIVE,一种将成功行为多样性转化为显式 RL 目标的 VLA 微调方法,通过分组对齐轨迹并基于相对行为多样性构建成功条件内在奖励。在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 上,DRIVE 将 π₀ 和 π₀.₅ 的平均 OOD 性能较原始 RL 微调分别提升 5.3 分和 2.0 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。