跳到正文
arXiv cs.LG· Nicol\`o Felicioni, Michael Benigni, Maurizio Ferrari Dacrema, Paolo Cremonesi·· 9 小时前AI 评分12

VOCEM:用联合效应建模实现方差最优的离策略评估

Variance-Optimal Off-Policy Evaluation with Conjunct Effect Modeling

AI 导读

针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。

来源:arXiv cs.LG · arxiv.org