KV Cache 显存成本:128K 上下文约 16 GB
热点事件持续更新
KV Cache 显存成本:128K 上下文约 16 GB
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
一篇技术文章解释了大模型推理中 KV Cache 的显存开销:以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例,每 token 缓存约 128 KB,128K 上下文下单请求缓存约 16 GB,与模型权重相当。 文章称,自回归生成分为预填充和解码两种负载:预填充计算密集,决定首字延迟;解码访存密集,决定出字速度,这也是 AI 越聊越慢的原因。 上述显存数字为文章按给定模型配置的估算结果,并非实测。
AI 根据报道生成 · 5 小时前更新
最新进展10月7日 12:19
KV Cache 精讲:AI 越聊越慢的原因与长上下文的显存成本报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- 掘金KV Cache 精讲:AI 越聊越慢的原因与长上下文的显存成本
文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。