arXiv cs.AI· Chung-En Ho, Weiyu Sun, Cheng-Jhih Shih, He Li, Yong Liu, Yingyan Celine Lin·· 9 小时前AI 评分24
SpecFold:折叠多分支冗余,加速扩散语言模型投机解码
SpecFold: Folding Multi-Branch Redundancy for Faster Speculative Decoding in Diffusion Language Models
AI 导读
SpecFold 通过折叠注意力与 FFN 复用父分支计算,减少扩散语言模型多分支投机验证中的冗余开销。在两类 DLLM 家族、五个模型和五个基准上,其吞吐量最高达 Spiffy 的 1.64 倍、原生解码的 1.99 倍,且任务性能相当。该算法与时间缓存正交,兼容现有 DLLM 投机策略。
来源:arXiv cs.AI · arxiv.org