跳到正文
arXiv cs.CV· Jiajun Cheng, Sainan Liu, Subarna Tripathi, Xiaofan Yu, Shan Lin·· 9 小时前AI 评分22

Latent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别

Latent-Action-Guided Video-Language Feature Learning for Surgical Instrument-Tissue Interaction Recognition

AI 导读

研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。

来源:arXiv cs.CV · arxiv.org