跳到正文
arXiv cs.LG· Zhenduo Zhao, Qihui Zhou, Mingcong Song, Zhiyi Chen, Chuangguan Ye, Fengfan Hou, Zequn Gong, Jing Li, Hongjie Si, Guoping Long·· 3 小时前AI 评分27

QUILT:通过共享查询执行重新思考稀疏注意力预填充

QUILT: Rethinking Sparse-Attention Prefill through Shared Query Execution

AI 导读

QUILT 是一种工作负载感知的稀疏注意力执行机制,通过联合处理相邻查询并复用共享 KV 条目,减少冗余内存流量与计算。在 LongBench 上基于 GLM-5.3 和 DeepSeek-3.2 评测,相比 SOTA 稀疏注意力 kernel,平均 kernel 延迟降低最多 55.1%,处理的 KV 数据减少最多 55.9%,TTFT 延迟降低最多 36.8%,精度损失可忽略。

来源:arXiv cs.LG · arxiv.org