跳到正文
arXiv cs.CV· Owen Du, Yang Yue, Jie Zhang, Jiaqi Pi, Chi Bene Chen, Gao Huang·· 5 小时前AI 评分22

VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 剪枝

VLA-ACL: Action-Consistent Visual Token Pruning for Efficient Vision-Language-Action Models

AI 导读

VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。

来源:arXiv cs.CV · arxiv.org