arXiv stat.ML· Ruimin He, Shaowei Lin·· 5 小时前AI 评分22
用动作驱动过程统一随机过程与强化学习,并应用于脉冲神经网络
Action-Driven Processes for Continuous-Time Control
AI 导读
论文提出"动作驱动过程",将随机过程与强化学习统一起来,并展示其在脉冲神经网络上的应用。借助 control-as-inference 思路,作者证明:对恰当定义的动作驱动过程,最小化策略驱动的真实分布与奖励驱动的模型分布之间的 KL 散度,等价于最大熵强化学习。
来源:arXiv stat.ML · arxiv.org