跳到正文
arXiv cs.AI· Hanyu Wang, Nakul Agarwal, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Makoto Fukushima, Jinghui Chen, Vaishnav Tadiparthi·· 3 小时前AI 评分22

推理强化学习轨迹采样中如何平衡参考引导与自由生成:ARG 方法

Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL

AI 导读

研究提出 Adaptive Reference Guidance(ARG),通过前缀续写与验证回退机制,在固定生成预算内构造正确轨迹,并应用于 GRPO 的全失败组。

来源:arXiv cs.AI · arxiv.org