跳到正文
arXiv cs.CV· Junzhe Shi, Yuan Gan, Shida Jiang·· 4 小时前AI 评分36

为什么 VLM 会漏掉小目标,以及何时放大是安全的

Why VLMs Miss Small Objects, and When Zooming In Is Safe

AI 导读

研究用图像接口的两个量 S(目标边长对应的视觉 token 数)和 L(单次调用需覆盖的内容)解释 VLM 漏检小目标的原因:整图在 N 个 token 内输入时,边长 m 的目标每边最多只有 m*sqrt(N/(WH)) 个 token,token 预算翻倍仅使整图可达的最大 S 提升 41%。

来源:arXiv cs.CV · arxiv.org