arXiv cs.CL· Wenjun Wang, Heng Li, Yanggan Gu, Hongxia Yang·· 4 小时前AI 评分22
OnlineQAT:面向超低比特大语言模型的在线策略蒸馏
OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models
AI 导读
OnlineQAT 是一个两阶段框架,先通过分块 QAT 获得可用的低比特初始化,再对学生模型自生成回答做在线策略蒸馏(OPD),由冻结的全精度教师模型在每个访问到的前缀上提供采样的 reverse-KL 训练信号。
来源:arXiv cs.CL · arxiv.org