研究:在线策略蒸馏可传播后门风险
热点事件持续更新
研究:在线策略蒸馏可传播后门风险
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
Jian Luo 等作者发表论文称,安全对齐但被植入后门的教师模型,可通过在线策略蒸馏(OPD)把隐藏的恶意行为传给原本干净的学生模型。在 3% 投毒率下,蒸馏后学生模型的攻击成功率(ASR)最高达 70%;仅用 10 个投毒样本,训练 16 个 epoch 后 ASR 即达 67%。 论文还称,常用的 top-k KL 会加速后门传播,在多数设置下比 sampled-token KL 更早出现由触发条件引发的不良行为;Lazy Defense 在低投毒率设置下可延迟后门传播。
AI 根据报道生成 · 8 小时前更新
最新进展10月7日 12:00
安全对齐的 on-policy distillation 会传播后门吗?3% 投毒率即可达 70% 攻击成功率报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.AI安全对齐的 on-policy distillation 会传播后门吗?3% 投毒率即可达 70% 攻击成功率
研究发现,安全对齐但被植入后门的教师模型可通过 on-policy distillation(OPD)将隐藏恶意行为传给原本干净的学生模型,3% 投毒率下攻击成功率(ASR)最高达 70%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。