跳到正文
热点事件持续更新

VLLR:机器人长时程任务稠密奖励框架

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Silong Yong 等作者提出 VLLR,一种面向长时程机器人任务的稠密奖励框架,结合 LLM/VLM 提供的外部奖励(用于识别任务进度)与基于策略自确定性的内在奖励,无需人工奖励工程即可微调机器人基础策略。 在 CHORES 基准上,作者报告 VLLR 相比预训练策略成功率最高提升 56%,分布内任务上超越 SOTA 强化学习微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。

AI 根据报道生成 · 7 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.LG
    VLLR:面向长时程机器人任务的通用稠密奖励框架

    VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。