arXiv cs.LG· Kelly Cui, Nikhil Prakash, Shoval Messica, Ayush Raina, David Bau, Antonio Torralba, Tamar Rott Shaham·· 5 小时前AI 评分26
视觉语言模型中的空间变量绑定双机制
The Dual Mechanisms of Spatial Variable Binding in Vision-Language Models
AI 导读
视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。
来源:arXiv cs.LG · arxiv.org