VLLR:机器人长时程任务稠密奖励框架
热点事件持续更新
VLLR:机器人长时程任务稠密奖励框架
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
Silong Yong 等作者提出 VLLR,一种面向长时程机器人任务的稠密奖励框架,结合 LLM/VLM 提供的外部奖励(用于识别任务进度)与基于策略自确定性的内在奖励,无需人工奖励工程即可微调机器人基础策略。 在 CHORES 基准上,作者报告 VLLR 相比预训练策略成功率最高提升 56%,分布内任务上超越 SOTA 强化学习微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
VLLR:面向长时程机器人任务的通用稠密奖励框架报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.LGVLLR:面向长时程机器人任务的通用稠密奖励框架
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。