跳到正文
arXiv cs.LG· Shripad V. Deshmukh, Yaswanth Chittepu, Dhawal Gupta, Philip Thomas, Scott Niekum·· 6 小时前AI 评分22

凸凹强化学习(CCRL):用差分凸优化求解策略学习

Convex-Concave Reinforcement Learning

AI 导读

研究者提出 Convex-Concave RL(CCRL),在 log-density-ratio 坐标下将每轮策略优化目标刻画为 DC 约束的 DC 规划,并用序列凸规划(SCP)求解,CPI、NPG、TRPO、AWR 均为其特例。多步 CCRL 在需跨时间步传播信用的诊断 MDP 上占优,在经典控制任务上与调优 PPO 相当,在随机中时段医疗场景中训练曲线面积比调优 PPO 高 11.3%。

来源:arXiv cs.LG · arxiv.org