跳到正文
热点事件持续更新

KV Cache 显存成本:128K 上下文约 16 GB

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

一篇技术文章解释了大模型推理中 KV Cache 的显存开销:以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例,每 token 缓存约 128 KB,128K 上下文下单请求缓存约 16 GB,与模型权重相当。 文章称,自回归生成分为预填充和解码两种负载:预填充计算密集,决定首字延迟;解码访存密集,决定出字速度,这也是 AI 越聊越慢的原因。 上述显存数字为文章按给定模型配置的估算结果,并非实测。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. 掘金
    KV Cache 精讲:AI 越聊越慢的原因与长上下文的显存成本

    文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。