跳到正文
arXiv cs.AI· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 11 小时前AI 评分24

RGPO:用自适应理由脚手架让大模型学会推理

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

AI 导读

研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。

来源:arXiv cs.AI · arxiv.org