跳到正文
arXiv cs.CL· Zakhar Kohut, Severyn Shykula, Mykola Vysotskyi, Serhii Dmytryshyn, Dmytro Khamula, Michal Zakrzewski, Damian Rynczak, Jacek Ma{\l}ecki, Taras Rumezhak, Volodymyr Karpiv·· 4 小时前AI 评分22

扩散语言模型的 Token 级提前停止:Just on Time

Just on Time: Token-Level Early Stopping for Diffusion Language Models

AI 导读

研究者提出一种免训练、Token 级的提前停止方法,让扩散语言模型在每个位置独立判断收敛,从而自适应冻结已稳定的 Token,减少所需扩散步数。该方法利用模型预测与局部上下文的轻量信号动态决定 Token 何时定稿,无需任务特定微调。在数学推理、通用问答和科学理解等多项基准上,该方法在保持生成质量的同时取得显著效率提升。

来源:arXiv cs.CL · arxiv.org