arXiv cs.LG· Junwei Su, Mengfan Liu, Yanyong Zhang, Chuan Wu·· 6 小时前AI 评分17
PPO-Clip 闭环非渐近收敛分析:学习型 Critic 与裁剪机制的理论研究
A Closed-Loop Non-Asymptotic Convergence Analysis of PPO with Learned Critics and Clipping
AI 导读
一项非渐近分析将 PPO-Clip 建模为闭环 actor-critic 系统,刻画了 actor-critic 耦合、非光滑概率比裁剪、有限批量复用与可预测早停。
来源:arXiv cs.LG · arxiv.org