跳到正文
arXiv cs.CL· Wenjun Wang, Heng Li, Yanggan Gu, Hongxia Yang·· 4 小时前AI 评分22

OnlineQAT:面向超低比特大语言模型的在线策略蒸馏

OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models

AI 导读

OnlineQAT 是一个两阶段框架,先通过分块 QAT 获得可用的低比特初始化,再对学生模型自生成回答做在线策略蒸馏(OPD),由冻结的全精度教师模型在每个访问到的前缀上提供采样的 reverse-KL 训练信号。

来源:arXiv cs.CL · arxiv.org