arXiv stat.ML· Yingying Fan, Yuxuan Han, Jinchi Lv, Xiaocong Xu, Zhengyuan Zhou·· 4 小时前AI 评分12
方差感知 UCB 下的分配稳定性与 Wald 推断
Allocation Stability and Wald Inference under Variance-Aware UCB
AI 导读
针对双臂固定时域方差感知 UCB 策略,研究给出由奖励差与方差决定的判别准则:最优臂拉取次数能否用相对误差趋零的确定性近似,而次优臂次数始终稳定。当各臂拉取次数与奖励方差之积依概率发散时,臂均值线性组合的普通 Wald 统计量对每个固定非零系数向量都有标准正态极限,但该高斯近似对确定性非零系数向量一致成立当且仅当最优臂次数稳定。
来源:arXiv stat.ML · arxiv.org