arXiv cs.CL· Saif Punjwani, Micah Goldblum·· 4 小时前AI 评分26
ExpDis:将探索与优化解耦的 RLVR 新框架
Decoupling Exploration from Optimization in RLVR
AI 导读
研究者提出 Exploration-Distillation(ExpDis)框架,将 RLVR 中的探索与优化解耦:先用带新颖性奖励的 explorer 策略采样轨迹,经正确性与质量过滤后蒸馏到独立 student 策略,student 训练时不加新颖性奖励,并多轮交替进行。
来源:arXiv cs.CL · arxiv.org