Universal Attention 实现 25× KV-Cache 压缩
热点事件持续更新
Universal Attention 实现 25× KV-Cache 压缩
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究者 Davis Wertheimer 等人提出名为 Universal Attention 的自剪枝注意力架构,用复合衰减机制作为自适应剪枝准则,剔除对注意力计算贡献最小的 token。该架构端到端可训练,同时保留 RoPE 位置编码和 Softmax 注意力。 据该研究,它在自然语言和合成任务上实现 10× KV-Cache 压缩,下游性能优于现有最优基线和未剪枝的 oracle;在 16k 序列长度下压缩比达到 25×。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
自剪枝 Transformer:Universal Attention 实现 25× KV-Cache 压缩报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LG自剪枝 Transformer:Universal Attention 实现 25× KV-Cache 压缩
研究者提出 Universal Attention,一种端到端可训练架构,用复合衰减机制作为自适应剪枝准则,剔除对注意力计算贡献最小的 token。它在自然语言和合成任务上实现 10× KV-Cache 压缩,下游性能优于 SOTA 基线和未剪枝 oracle,并在 16k 长度下达到 25× 压缩。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。