arXiv cs.CL· Yifan Zhang·· 4 小时前AI 评分24
KLPO:以采样器为锚的 KL 正则化策略优化框架
On KL-Regularized Policy Optimization
AI 导读
研究者提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则项锚定在采样器上,使正则化改进步骤具有闭式 Gibbs 解,并通过对采样器自身轨迹做最小二乘拟合对数比最优条件,无需重要性权重。
来源:arXiv cs.CL · arxiv.org