跳到正文
热点事件观察中

WakeKV:可逆KV缓存驻留策略

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Utkarsh Ranjan 等人提出 WakeKV,一种面向大模型推理的响应式 KV 缓存驻留策略:把读取行为“冷却”的注意力头状态移入可恢复的 CPU 存储池,而不是冻结或永久驱逐。 研究在 1.5B–8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为;在匹配内存或预算下,WakeKV 持续优于冻结分类与破坏性驱逐。研究称,在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升,并保持 LongBench 质量。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CL
    WakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略

    WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。