跳到正文
arXiv cs.AI· Fei Zhang, Zhaochong An, Duncan Frost, Yikai Wang, Pengfei Liu, Ya Zhang, Michal Drozdzal, Amir Bar·· 1 天前AI 评分32

ProWAM:渐进式视觉规划的世界动作模型,在 LIBERO-Plus 与 RoboTwin 刷新 SOTA

World Action Modeling with Progressive Visual Planning

AI 导读

ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上达到 75.7%,相对最强基线提升最高 +35.9%;零样本真实场景成功率为 70.0%,较基线 55.0% 提升 +15.0。

来源:arXiv cs.AI · arxiv.org