研究:VLM漏检小目标源于token预算限制
热点事件持续更新
研究:VLM漏检小目标源于token预算限制
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Junzhe Shi 等人发表论文,用两个量解释视觉语言模型(VLM)为何漏检小目标:S 是目标边长对应的视觉 token 数,L 是单次调用需覆盖的内容。整图在 N 个 token 内输入时,边长 m 的目标每边最多只有 m*sqrt(N/(WH)) 个 token,因此 token 预算翻倍也只能把整图可达的最大 S 提升 41%。 论文围绕三个问题展开:什么限制了 VLM、其中哪些限制能被更好的模型消除、以及处理大图的经典做法局部图像分解是否仍有前景。
AI 根据报道生成 · 3 小时前更新
最新进展10月8日 12:00
为什么 VLM 会漏掉小目标,以及何时放大是安全的报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CV为什么 VLM 会漏掉小目标,以及何时放大是安全的
研究用图像接口的两个量 S(目标边长对应的视觉 token 数)和 L(单次调用需覆盖的内容)解释 VLM 漏检小目标的原因:整图在 N 个 token 内输入时,边长 m 的目标每边最多只有 m*sqrt(N/(WH)) 个 token,token 预算翻倍仅使整图可达的最大 S 提升 41%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。