arXiv cs.LG· Doseok Jang, Jon Ander Campos, Youran Qi·· 1 天前AI 评分24
LMOPD:字典序多目标同策略蒸馏
Lexicographic Multi-Objective On-Policy Distillation
AI 导读
研究者提出 Lexicographic Multi-Objective On-Policy Distillation(LMOPD),一种按显式优先级整合奖励专精策略的多教师方法,通过字典序路由与对数策略修正投影保护高优先级能力。
来源:arXiv cs.LG · arxiv.org