跳到正文
热点事件持续更新

BoT-GRPO:Token袋聚合的高效过程奖励RL

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者提出 BoT-GRPO,把 GRPO 扩展到 token 级奖励模型:通过长度不变的“bag of tokens”聚合,按序列长度倒数加权计算每个 token 的优势,无需 critic 网络,可直接替换 GRPO。 该方法面向推理任务的过程奖励强化学习,由 Yingxiang Yang 等作者以预印本形式发布。论文称其无需 critic 网络即可完成 token 级奖励的训练,但摘要未给出与 GRPO 对比的实验结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    BoT-GRPO:用 Bag-of-Token 聚合实现高效过程奖励推理 RL

    研究者提出 BoT-GRPO,将 GRPO 扩展到 token 级奖励模型,通过长度不变的"bag of tokens"聚合按序列长度倒数加权计算 per-token 优势,无需 critic 网络,可直接替换 GRPO。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。