跳到正文
arXiv cs.LG· Qitong Wang, Xinwei Niu, Mingluo Su, Shanwei Zhao, Shiai Zhu, Huan Wang·· 3 小时前AI 评分27

SparseDecoding:面向 LLM 解码的剪枝框架,A100 上解码提速最高 1.48 倍

SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference

AI 导读

SparseDecoding 是一个面向 LLM 解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)过程中收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐。

来源:arXiv cs.LG · arxiv.org