跳到正文
arXiv cs.LG· Shengfan Cao, Francesco Borrelli·· 9 小时前AI 评分17

交错投影梯度下降:面向安全模仿学习的神经网络控制策略

Interleaved Projected Gradient Descent for Safe Imitation Learning

AI 导读

研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。

来源:arXiv cs.LG · arxiv.org