跳到正文
arXiv cs.CL· Runguo Li·· 4 小时前AI 评分22

BreadthKV:长链式推理解码期 KV 压缩的精度与数量权衡

Spend Bytes on Breadth: Precision-Count Trade-offs for Decode-Time KV Compression in Long Chain-of-Thought Reasoning

AI 导读

BreadthKV 提出在固定字节预算下,将更多字节分配给低精度 KV token 数量而非精度,结合量化与驱逐,并通过 60 题端到端校准为每个模型和预算选择位宽。在三个推理模型和四个数学与科学基准上,它在 18 个设置中有 17 个优于纯驱逐方法,并生成更短输出。在最紧预算下,Qwen3-8B 上驱逐方法使 91% 的 AIME 样本触及长度上限,BreadthKV 仅为 40%。

来源:arXiv cs.CL · arxiv.org