跳到正文
arXiv cs.CV· Hao Jiang, Yiru Mao, Tianpeng Bu, Hao Zhou, Hongtao Duan, Wang Jing, Bowen Xu, Xin Chen, Lulu Hu, Bin Yang, Yongliang Tao, Minying Zhang·· 3 小时前AI 评分29

V-CoLA:面向线性注意力的视觉 Token 压缩方法

V-CoLA: Vision Token Compression with Linear Attention

AI 导读

V-CoLA 是一个免训练的视觉 token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知重要性准则筛选关键视觉 token,并配合自适应 token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 token 即可达到原性能的 99.5%,降至 12.5% 时仍保留 88.0% 以上,prefill 提速 1.86× 至 6.15×。

来源:arXiv cs.CV · arxiv.org