arXiv cs.LG· Zicheng Hu, Zhijian Zhou, Xuan Zhang, Yuchen Liu, Cheng Chen, Yuan Li, Qi Gu, Yan Feng, Hongyan Hao, Chao Qu·· 6 小时前AI 评分26
COPC:面向异步 LLM 强化学习的耦合离策略校正方法
COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning
AI 导读
针对异步 RL 训练大语言模型时轨迹陈旧的问题,研究者提出耦合离策略校正方法 COPC,将 token 级比率掩码与 TD 残差的双侧裁剪比率加权结合,协同校正策略侧与优势估计侧的失配。COPC 在工具集成数学推理与搜索任务上取得已报告最高性能,优于最强异步基线,并在 64 步策略陈旧度下保持稳定,相比同步 PPO 保留 1.7 倍步时加速。
来源:arXiv cs.LG · arxiv.org