跳到正文
arXiv cs.LG· SungJae Ahn, Jeong Woon Lee, Kyoleen Kwak, Hyoseok Hwang·· 9 小时前AI 评分22

重新审视深度强化学习中的时间正则化:CATS 实现平滑控制

Revisiting Temporal Regularization for Smooth Control in Deep Reinforcement Learning

AI 导读

研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。

来源:arXiv cs.LG · arxiv.org