跳到正文
arXiv cs.CV· Masatoshi Tateno, Takehiko Ohkawa, Yueh-Hua Wu, Hanlong Li, Tatsuya Matsushima, Yoichi Sato, Kei Ota·· 4 小时前AI 评分24

YUBI-STAG:通过自动化视频-语言 grounding 为 VLA 模型实现接触与语义丰富的对齐

YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding

AI 导读

YUBI-STAG 是一个通过自动化视频-语言 grounding 为 VLA 模型提供时空标注与对齐的框架,可标注物体身份、属性、状态、各夹爪动作、双手协调及空间交互信息。

来源:arXiv cs.CV · arxiv.org