arXiv cs.CV· Seungjun Moon, Subin Jeon, Sangwoo Kim, Hanbyul Joo, Jinwoo Shin·· 4 小时前AI 评分26
RLHND:以视频基础模型作为物理接地的机器人学习手部追踪器
RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning
AI 导读
RLHND 是一种基于视频基础模型的手部追踪模型,可从单目第一视角视频中联合估计手部姿态与真实触觉信息。它将预训练的 Cosmos 3 视频扩散骨干通过 clean-latent conditioning 转为确定性片段级特征提取器,并采用独立触觉专家流预测手部表面的密集接触与力。RLHND 在姿态估计及接触与力估计的多项基准数据集上均达到 SOTA,代码将公开。
来源:arXiv cs.CV · arxiv.org