跳到正文
热点事件持续更新

Universal Attention 实现 25× KV-Cache 压缩

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者 Davis Wertheimer 等人提出名为 Universal Attention 的自剪枝注意力架构,用复合衰减机制作为自适应剪枝准则,剔除对注意力计算贡献最小的 token。该架构端到端可训练,同时保留 RoPE 位置编码和 Softmax 注意力。 据该研究,它在自然语言和合成任务上实现 10× KV-Cache 压缩,下游性能优于现有最优基线和未剪枝的 oracle;在 16k 序列长度下压缩比达到 25×。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    自剪枝 Transformer:Universal Attention 实现 25× KV-Cache 压缩

    研究者提出 Universal Attention,一种端到端可训练架构,用复合衰减机制作为自适应剪枝准则,剔除对注意力计算贡献最小的 token。它在自然语言和合成任务上实现 10× KV-Cache 压缩,下游性能优于 SOTA 基线和未剪枝 oracle,并在 16k 长度下达到 25× 压缩。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。