跳到正文
热点事件持续更新

BreadthKV:解码期KV缓存压缩新方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Runguo Li 等人提出 BreadthKV,一种长链式推理解码期的 KV 缓存压缩方法:在固定字节预算下,把更多字节用于容纳低精度的 KV token 数量,而非提高精度,并将量化与驱逐结合。该方法通过 60 题端到端校准,为每个模型和预算选择位宽,因为离线注意力误差无法可靠预测实际效果。 在三个推理模型和四个数学与科学基准上,BreadthKV 在 18 个设置中的 17 个优于纯驱逐方法,且输出更短。在最紧预算下,Qwen3-8B 上驱逐方法使 91% 的 AIME 样本触及长度上限,BreadthKV 为 40%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    BreadthKV:长链式推理解码期 KV 压缩的精度与数量权衡

    BreadthKV 提出在固定字节预算下,将更多字节分配给低精度 KV token 数量而非精度,结合量化与驱逐,并通过 60 题端到端校准为每个模型和预算选择位宽。在三个推理模型和四个数学与科学基准上,它在 18 个设置中有 17 个优于纯驱逐方法,并生成更短输出。在最紧预算下,Qwen3-8B 上驱逐方法使 91% 的 AIME 样本触及长度上限,BreadthKV 仅为 40%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。