跳到正文
arXiv cs.LG· Yingyu Shan, Yuhang Guo, Zihao Cheng, Zeming Liu, Xiangrong Zhu, Xinyi Wang, Jiashu Yao, Wei Lin, Hongru Wang, Heyan Huang·· 3 小时前AI 评分22

SC-GRPO:用自条件信用分配改进 RLVR 训练

Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards

AI 导读

SC-GRPO 通过将模型在自身已验证轨迹上的 KL 散度作为 GRPO 梯度的乘性权重,实现 token 级信用分配,无需过程奖励模型或外部教师。在数学、代码和智能体任务的五个基准上,SC-GRPO 比 GRPO 高 8.1%、比 DAPO 高 5.9%,OOD 表现更强,并优于 OPD。该工作已被 EMNLP 2026 Findings 接收。

来源:arXiv cs.LG · arxiv.org