arXiv cs.CV· Seyoung Jeong, Jong Pil Yun, Sang Jun Lee·· 4 小时前AI 评分22
ReFIT:面向加速图像理解的自适应视觉 token 缩减框架
Adaptive Visual Token Reduction for Accelerated Image Understanding
AI 导读
针对高分辨率图像处理中视觉 token 缩减方法难以保留空间结构信息的问题,研究者提出 ReFIT——一种指令引导的视觉 token 缩减框架,由 Relevance-Guided Window Reshaping(RWR)和 Instruction-Guided Token Refinement(ITR)两部分组成。
来源:arXiv cs.CV · arxiv.org