跳到正文
arXiv cs.LG· Davis Wertheimer, Haochen Shen, Ahan Gupta, Derrick Liu, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang·· 6 小时前AI 评分27

自剪枝 Transformer:Universal Attention 实现 25× KV-Cache 压缩

A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention

AI 导读

研究者提出 Universal Attention,一种端到端可训练架构,用复合衰减机制作为自适应剪枝准则,剔除对注意力计算贡献最小的 token。它在自然语言和合成任务上实现 10× KV-Cache 压缩,下游性能优于 SOTA 基线和未剪枝 oracle,并在 16k 长度下达到 25× 压缩。

来源:arXiv cs.LG · arxiv.org