跳到正文
arXiv cs.LG· Yingxiang Yang, Weihang Xiao, Zhunxuan Wang, Joshua Flashner, Niresh Agarwal·· 6 小时前AI 评分27

BoT-GRPO:用 Bag-of-Token 聚合实现高效过程奖励推理 RL

BoT-GRPO: Efficient Process-Reward RL for Reasoning via Bag-of-Token Aggregation

AI 导读

研究者提出 BoT-GRPO,将 GRPO 扩展到 token 级奖励模型,通过长度不变的"bag of tokens"聚合按序列长度倒数加权计算 per-token 优势,无需 critic 网络,可直接替换 GRPO。

来源:arXiv cs.LG · arxiv.org