arXiv cs.AI· Hongyao Liu, Liuqun Zhai, Junyi Wang, Zhengru Fang, Jingshu Chen, Jun Huang·· 3 小时前AI 评分22
SparKV:面向端侧 LLM 推理的感知开销 KV Cache 加载框架
SparKV: Overhead-Aware KV Cache Loading for Efficient On-Device LLM Inference
AI 导读
SparKV 是一种结合云端 KV 流式传输与端侧计算的自适应 KV 加载框架,通过建模各 KV chunk 的开销来决定其流式传输还是本地计算,并重叠两条执行路径以降低延迟。实验显示,该框架在多种数据集、LLM 和边缘设备上将首 token 延迟(Time-to-First-Token)降低 1.3x-5.1x,单请求能耗降低 1.5x-3.3x,且对响应质量影响可忽略。
来源:arXiv cs.AI · arxiv.org