arXiv cs.AI· Yifei Liu, Minghao Fang, Xinyu Gu, Chengkai Yao, Mengdi Liu, Tengfei Ma, Jiangbin Zheng, Chang Yu, Zhangyang Gao·· 5 小时前AI 评分22
E$^2$-OPSD:解决在线策略自蒸馏中的熵过冲问题
E$^2$-OPSD: Taming Entropy Overshoot in On-Policy Self-Distillation
AI 导读
研究者提出 E$^2$-OPSD,用于解决在线策略自蒸馏(OPSD)中"熵过冲"的失败模式:学生 token 熵超过教师并持续偏高。该方法用检索到的已解邻近问题替代当前答案进行示例引导教学,并依据学生-教师熵差决定每个 token 的修正方向与强度。
来源:arXiv cs.AI · arxiv.org