跳到正文
arXiv cs.LG· Heng Liang, Xinwen Zhang, Hongchang Gao·· 5 小时前AI 评分18

BiToK-SD:面向大语言模型自蒸馏的双层 Top-K token 选择方法

Learning What to Distill: Bilevel Top-K Token Selection for Self-Distillation in Large Language Models

AI 导读

研究者提出 BiToK-SD,一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中自适应学习哪些 token 位置最值得蒸馏。该方法将 Top-K token 选择建模为可微的阈值松弛作为下层问题,上层问题则对选中位置执行知识蒸馏,使选择随学生策略演化而调整。在数学推理基准上,BiToK-SD 在全部对比方法中取得最佳平均性能,且仅需轻量额外计算。

来源:arXiv cs.LG · arxiv.org