跳到正文
arXiv cs.LG· Hejian Sang, Zhengze Zhou, Shayan Mohajer Hamidi, Xiaomin Li, Rohit Jain, Alborz Geramifard·· 6 小时前AI 评分22

Δ-MOPD:通过教师相对偏移实现多教师同策略蒸馏

Composing What Each Teacher Learned: Multi-Teacher On-Policy Distillation through Teacher-Relative Shifts

AI 导读

研究者提出 Δ-MOPD,将每位教师的 teacher-minus-base logit shift 重新锚定在学生冻结初始化上,而非直接迁移教师的端点策略。在三个教师组合下,Δ-MOPD 比端点组合在 Math 上高 4.11 分、五项基准上高 1.95 分;分阶段路由下平均性能更高,顺序差距从 10.50 降至 6.42 分。结果表明目标构建是多教师同策略蒸馏中独立于教师选择的设计维度。

来源:arXiv cs.LG · arxiv.org