跳到正文
arXiv cs.AI· Peng Cheng, Yunxian Hou, Zhi Zhou, Qian Zhang, Chang Huang, Xianyuan Zhan·· 3 小时前AI 评分24

高阶动作监督让策略类更强:一种即插即用的离线 RL 损失方案

Higher-Order Action Supervision Makes A Strong Policy Class

AI 导读

一项被 NeurIPS 2026 接收的研究提出同时监督零阶和一阶动作的损失方案,可为任意现成策略模型(确定性、随机或 flow 策略)赋予高阶动作监督能力,无需改动结构。该方法可作为即插即用模块接入现有离线 RL 框架,在 OGBench 和 D4RL 上显著提升连续控制任务的性能与鲁棒性,并改善低数据下的 OOD 泛化。

来源:arXiv cs.AI · arxiv.org