arXiv cs.CL· Xu Yang, Jiapeng Zhang, Yuxin Chen, Feiqiang Sun, Chengguang Xu, Feng Jin, Zhuo Tang·· 4 小时前AI 评分27
Self-Indexing Attention:面向压缩兼容稀疏长上下文 LLM 推理的无训练框架
Self-Indexing Attention for Compression-Compatible Sparse Long-Context LLM Inference
AI 导读
Self-Indexing Attention 是一个无需训练的稀疏长上下文推理框架,基于共享变换域符号-幅值表示,用 1-bit 索引同时支持分组 prefill 选择与 decode 检索。
来源:arXiv cs.CL · arxiv.org