掘金· 柯南4668·· 7 小时前AI 评分62
KV Cache 精讲:AI 越聊越慢的原因与长上下文的显存成本
【AI工程师精讲】KV Cache 精讲:为什么 AI 越聊越慢,以及长上下文真正的成本在哪
AI 导读
文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。
来源:掘金 · juejin.cn