WakeKV:可逆KV缓存驻留策略
热点事件观察中
WakeKV:可逆KV缓存驻留策略
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Utkarsh Ranjan 等人提出 WakeKV,一种面向大模型推理的响应式 KV 缓存驻留策略:把读取行为“冷却”的注意力头状态移入可恢复的 CPU 存储池,而不是冻结或永久驱逐。 研究在 1.5B–8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为;在匹配内存或预算下,WakeKV 持续优于冻结分类与破坏性驱逐。研究称,在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升,并保持 LongBench 质量。
AI 根据报道生成 · 14 小时前更新
最新进展10月5日 12:00
WakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv cs.CLWakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略
WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。