arXiv cs.AI· Chence Yang, Ningxi Cheng, Arash Akbari, Qitao Tan, Qingchan Zhu, Ci Zhang, Changdi Yang, Yanzhi Wang, Wei Niu, Jinhui Wang, Jin Lu, Geng Yuan·· 9 小时前AI 评分22
BitNest:面向内存高效 LLM 推理加速的位嵌套投机解码
BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration
AI 导读
BitNest 是一种位嵌套投机解码框架,将低精度草稿模型直接嵌入高精度目标模型的权重表示中,两者共享同一份物理权重,并把渐进精度设计扩展到 KV cache 以支持长上下文推理。
来源:arXiv cs.AI · arxiv.org