arXiv cs.LG· Mahmoud Selim, Cristina Cipriani, Karl Henrik Johansson·· 6 小时前AI 评分22
ICDP:面向自动驾驶的交互约束离线强化学习框架
Beyond Policy Support: Interaction Constrained Offline Reinforcement Learning for Autonomous Driving
AI 导读
针对离线强化学习中策略优化可能选中离线数据支持不足动作的问题,研究者提出交互约束驾驶策略(ICDP)框架,将交互分布偏移(IDS)分解为ego支持与残差交互支持两部分,并通过对比密度比估计恢复交互兼容性,无需联合密度建模或世界模型推演。在nuPlan、InterPlan及真实卡车实验的闭环评测中,ICDP抑制了高价值但交互不支持轨迹的选择,提升了交互关键场景下的驾驶表现。
来源:arXiv cs.LG · arxiv.org