arXiv cs.LG· Qitong Wang, Xinwei Niu, Mingluo Su, Shanwei Zhao, Shiai Zhu, Huan Wang·· 3 小时前AI 评分27
SparseDecoding:面向 LLM 解码的剪枝框架,A100 上解码提速最高 1.48 倍
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
AI 导读
SparseDecoding 是一个面向 LLM 解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)过程中收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐。
来源:arXiv cs.LG · arxiv.org