跳到正文
arXiv cs.CV· Taojie Zhu, Jing Jin, Yuan Xia, Chenyang Ding, Qunshan He, Wanke Xia, Tao Sun, Yan Chen, Jian Wang, Jinjie Gu, Tao Feng·· 9 小时前AI 评分22

UP-MOPD:多教师在线策略蒸馏中的更新投影

UP-MOPD: Update Projection in Multi-Teacher On-Policy Distillation

AI 导读

针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。

来源:arXiv cs.CV · arxiv.org