arXiv cs.CV· Donghyun Han, Jangho Park, Yuseok Bae·· 5 小时前AI 评分22
Foveated Compression:为 token 高效 VLM 选择性保留高分辨率
Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs
AI 导读
研究者提出 Foveated Compression,将全分辨率图像编码一次,用原生分辨率与压缩分辨率视觉 token 混合表示,并训练行为自蒸馏的 Foveated Merger 与轻量 Foveated Selector 从九个空间单元中选一个保留原生分辨率。
来源:arXiv cs.CV · arxiv.org