跳到正文
arXiv cs.LG· Linfeng Dong·· 6 小时前AI 评分34

KVFetch:为 KV Cache 压缩缺失的另一半提供时序预取

KVFetch: Temporal Prefetching for the Missing Half of KV Cache Compression

AI 导读

针对现有 KV cache 压缩方法只按内容相关性决定保留或召回、忽略按位置顺序遍历这一访问模式的问题,研究者提出免训练即插即用框架 KVFetch,通过量化冷层、单调读指针检测复制行为并预取位置后继。在 RULER-16K 等预算控制下,KVFetch 将逐字复制得分从 0.8 提升至 78.4,13 项任务平均提升 +8.4;在无需顺序访问的 LongBench 上该通道保持休眠、不产生开销。

来源:arXiv cs.LG · arxiv.org