跳到正文
热点事件持续更新

V-CoLA:面向线性注意力的视觉Token压缩框架

1 篇报道1 个报道来源2 小时前更新

先了解这件事

报道摘要

V-CoLA 是一个免训练的视觉 token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知重要性准则筛选关键视觉 token,并配合自适应 token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 token 即可达到原性能的 99.5%,降至 12.5% 时仍保留 88.0% 以上,prefill 提速 1.86× 至 6.15×。

摘自 arXiv cs.CV

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CV
    V-CoLA:面向线性注意力的视觉 Token 压缩方法

    V-CoLA 是一个免训练的视觉 token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知重要性准则筛选关键视觉 token,并配合自适应 token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 token 即可达到原性能的 99.5%,降至 12.5% 时仍保留 88.0% 以上,prefill 提速 1.86× 至 6.15×。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。