arXiv cs.CV· Masatoshi Tateno, Takehiko Ohkawa, Yueh-Hua Wu, Hanlong Li, Tatsuya Matsushima, Yoichi Sato, Kei Ota·· 4 小时前AI 评分24
YUBI-STAG:通过自动化视频-语言 grounding 为 VLA 模型实现接触与语义丰富的对齐
YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding
AI 导读
YUBI-STAG 是一个通过自动化视频-语言 grounding 为 VLA 模型提供时空标注与对齐的框架,可标注物体身份、属性、状态、各夹爪动作、双手协调及空间交互信息。
来源:arXiv cs.CV · arxiv.org