arXiv cs.LG· Yongqiang Yao, Jinru Tan, Kaihuan Liang, Zixin Yin, Yazhe Niu, Ruihao Gong, Dahua Lin, Ningyi Xu·· 6 小时前AI 评分24
RollVerify:在长尾 rollout 强化学习中兼顾效率与准确率
RollVerify: Bridging Efficiency and Accuracy in Long-Tail Rollout Reinforcement Learning
AI 导读
针对长尾 rollout 导致的 GPU 空泡与异步部分 rollout 引入的 off-policy 样本问题,研究者提出轻量级 RL 框架 RollVerify,通过 off-policy shift 指标 OPS 量化偏差,并在序列级和 token 级验证、截断无效轨迹后缀。
来源:arXiv cs.LG · arxiv.org