跳到正文
热点事件持续更新

热启动Bandit离线攻击新范式提出

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Qirun Zeng等作者提出针对热启动Bandit的有界离线攻击方法:攻击者只需在部署前向热启动历史注入合法的动作-奖励对,即可诱导UCB在几乎所有在线轮次选择目标臂。该研究覆盖UCB、Thompson Sampling、ε-greedy等算法。 作者称,理论证明当目标臂接近奖励下界时,任何近最优成本的攻击都必须把不可忽略的成本份额分配给目标臂,而非仅压制非目标臂,并将这一思路称为“目标推广”新范式。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击

    针对热启动 Bandit 的离线攻击研究提出"目标推广"新范式:攻击者仅向热启动历史注入合法动作-奖励对,即可诱导 UCB 在几乎所有在线轮次选择目标臂。理论证明当目标臂接近奖励下界时,任何近最优成本攻击都必须将不可忽略的成本份额分配给目标臂,而非仅压制非目标臂。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。