arXiv cs.CV· Yuchen Zhu, Chenyi Xu, Yulin Zhang, Gang Xu, Wentao Zhu·· 4 小时前AI 评分29
Juno:为视觉-语言-动作模型驯服预测性潜变量
Juno: Taming Predictive Latents for Vision-Language-Action Models
AI 导读
Juno 是一个围绕单一动作条件 JEPA 构建的统一框架,同时充当控制对齐的表征骨干、预测教师和可适应动力学模型。在 SimplerEnv 上,Juno 将平均成功率从最强基线 Qwen3GR00T 的 60.9% 提升至 68.5%,测试时适应后进一步达到 72.7%;在真实机器人上,面对背景、高度和物体变化时仍保持 70%–75% 成功率,而基础策略降至 0%。
来源:arXiv cs.CV · arxiv.org