跳到正文
arXiv cs.LG· Qirun Zeng, Manhin Poon, Xiangxiang Dai, Qixin Zhang, Jinhang Zuo·· 6 小时前AI 评分18

超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击

Beyond Reward Suppression: Near-Optimal Offline Attacks on Warm-Start Bandits with Bounded Rewards

AI 导读

针对热启动 Bandit 的离线攻击研究提出"目标推广"新范式:攻击者仅向热启动历史注入合法动作-奖励对,即可诱导 UCB 在几乎所有在线轮次选择目标臂。理论证明当目标臂接近奖励下界时,任何近最优成本攻击都必须将不可忽略的成本份额分配给目标臂,而非仅压制非目标臂。

来源:arXiv cs.LG · arxiv.org