跳到正文
arXiv cs.LG· Junwei Su, Mengfan Liu, Yanyong Zhang, Chuan Wu·· 6 小时前AI 评分17

PPO-Clip 闭环非渐近收敛分析:学习型 Critic 与裁剪机制的理论研究

A Closed-Loop Non-Asymptotic Convergence Analysis of PPO with Learned Critics and Clipping

AI 导读

一项非渐近分析将 PPO-Clip 建模为闭环 actor-critic 系统,刻画了 actor-critic 耦合、非光滑概率比裁剪、有限批量复用与可预测早停。

来源:arXiv cs.LG · arxiv.org