热启动Bandit离线攻击新范式提出
热点事件持续更新
热启动Bandit离线攻击新范式提出
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Qirun Zeng等作者提出针对热启动Bandit的有界离线攻击方法:攻击者只需在部署前向热启动历史注入合法的动作-奖励对,即可诱导UCB在几乎所有在线轮次选择目标臂。该研究覆盖UCB、Thompson Sampling、ε-greedy等算法。 作者称,理论证明当目标臂接近奖励下界时,任何近最优成本的攻击都必须把不可忽略的成本份额分配给目标臂,而非仅压制非目标臂,并将这一思路称为“目标推广”新范式。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LG超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击
针对热启动 Bandit 的离线攻击研究提出"目标推广"新范式:攻击者仅向热启动历史注入合法动作-奖励对,即可诱导 UCB 在几乎所有在线轮次选择目标臂。理论证明当目标臂接近奖励下界时,任何近最优成本攻击都必须将不可忽略的成本份额分配给目标臂,而非仅压制非目标臂。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。