跳到正文
arXiv cs.CL· Peng Xie, Amr Alanwar·· 9 小时前AI 评分29

V-JEPA 2 等视频世界模型能否记住被遮挡物体?研究揭示其物体永久性缺失

Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object

AI 导读

研究将物体从冻结的 V-JEPA 2 预测器中隐藏,发现其预测对静止物体仅部分保留、对容器内物体完全丢失,运动物体在 0.3 秒内即消失(V-JEPA 自带 tube mask 下为 0.5 秒,ViT-H 在 90% 掩码率下可保留至 1.1 秒)。

来源:arXiv cs.CL · arxiv.org