新方法用潜动作提升手术视频识别
热点事件持续更新
新方法用潜动作提升手术视频识别
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
研究者提出一种名为 Latent-Action-Guided 的视频-语言特征学习方法,将帧间变化压缩为“潜动作”,并在端到端视频-语言对齐过程中预测下一帧特征,用于手术器械与组织交互识别。该方法无需额外空间或运动标注,即可提升交互定位与时间方向敏感性。 在使用无大规模视频预训练的图像编码器时,该方法的识别性能与 V-JEPA2/2.1 相当,同时推理更快、INT4 精度下降更小。上述结论来自作者在论文中的报告。
AI 根据报道生成 · 3 小时前更新
最新进展10月7日 12:00
Latent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CVLatent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别
研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。