跳到正文
arXiv cs.AI· Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Mingyi Hong·· 9 小时前AI 评分22

SORL:用轮次级重要性采样与裁剪触发归一化稳定长程 LLM 智能体的离策略训练

Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

AI 导读

针对 PPO、GRPO 等 RL 算法在离策略训练多轮 LLM 智能体时优化不稳定、易性能崩溃的问题,研究者提出 SORL 框架,并实例化出 SO-PPO 与 SO-GRPO 两种算法。

来源:arXiv cs.AI · arxiv.org