arXiv cs.AI· Guhyeon Kang, Minhae Kwon·· 12 小时前AI 评分22
VAN-Flow:面向稀疏长时程环境的方差规避 n 步离线强化学习
Variance-Averse $n$-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments
AI 导读
VAN-Flow 是一个面向生成式离线强化学习的框架,通过类别分布式 critic、方差规避期望算子和基于拒绝采样的流匹配生成 actor,在 D4RL 与 OGBench 的 40 多个任务上持续超越强基线,长时程与高方差场景增益最大。该工作已被 NeurIPS 2026 接收。
来源:arXiv cs.AI · arxiv.org