跳到正文
arXiv cs.LG· Lan Shi, Daigo Shishika, Xuan Wang·· 11 小时前AI 评分15

通过有限深度策略敏感性适应智能体行为变化

Adapting to Changes in Agent Behavior via Finite-Depth Policy Sensitivity

AI 导读

研究者提出一种有限深度框架,通过近似策略 Hessian 和混合导数来估计策略敏感性,从而适应其他智能体行为变化,无需大量新交互数据。该方法具有可调节的传播深度,并推导了截断误差界,深度越大误差越小,全时域传播时误差消失。在信念驱动的追逃博弈中,该方法估计精度和策略适应均优于基线,基于敏感性的初始化提升了零样本回报及后续微调效果。

来源:arXiv cs.LG · arxiv.org