跳到正文
arXiv cs.CL· Yifan Zhang·· 4 小时前AI 评分24

KLPO:以采样器为锚的 KL 正则化策略优化框架

On KL-Regularized Policy Optimization

AI 导读

研究者提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则项锚定在采样器上,使正则化改进步骤具有闭式 Gibbs 解,并通过对采样器自身轨迹做最小二乘拟合对数比最优条件,无需重要性权重。

来源:arXiv cs.CL · arxiv.org