跳到正文
arXiv cs.LG· Samuel Tetteh, Cody Fleming·· 6 小时前AI 评分22

平均安全、尾部不安全:情节成本的尾部何时可控?

Safe on Average, Unsafe in the Tail: When Is the Episodic-Cost Tail Controllable?

AI 导读

安全强化学习通常只约束期望情节成本,导致策略可能平均达标却在最差情节中不安全。该研究用 CVaR_0.1(最差 10% 情节的平均成本)衡量尾部风险,在 Safety-Gymnasium 三个导航任务上评估五种标准算法,识别出平均安全但尾部不安全的策略,并在四个导航与四个运动任务上检验四类约束的尾部控制能力。

来源:arXiv cs.LG · arxiv.org