跳到正文
arXiv stat.ML· Raphael C Kim, Jingsen Zhu, Ramin Zabih, Michele Santacatterina·· 4 小时前AI 评分22

好的生成器就是好的决策者吗?通过重定向反事实生成实现通用干预的策略学习

Are Good Generators Good Decision-Makers? Policy Learning for General Interventions via Retargeted Counterfactual Generation

AI 导读

研究提出"通过重定向反事实生成进行策略学习"方法,分三步训练生成器以支持决策:先学习双重稳健的不变反事实生成器处理高维干预与结果,再基于其 rollout 做策略学习,最后将生成器重定向至所学策略的干预并重新学习策略。

来源:arXiv stat.ML · arxiv.org