跳到正文
热点事件持续更新

YUBI-STAG 视频-语言对齐框架发布

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Masatoshi Tateno 等作者发布 YUBI-STAG 框架,用于自动为机器人操作演示补充交互语义,使预训练的 VLA(视觉-语言-动作)模型与细粒度操作语言对齐。 该框架通过自动化视频-语言 grounding 提供时空标注,可标注物体身份、属性、状态、各夹爪动作、双手协调及空间交互信息,并附带一个蒸馏模型 YUBI-VLM。上述内容来自作者在 arXiv cs.CV 发布的一手论文,效果以论文所述为准。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CV
    YUBI-STAG:通过自动化视频-语言 grounding 为 VLA 模型实现接触与语义丰富的对齐

    YUBI-STAG 是一个通过自动化视频-语言 grounding 为 VLA 模型提供时空标注与对齐的框架,可标注物体身份、属性、状态、各夹爪动作、双手协调及空间交互信息。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。