跳到正文
热点事件持续更新

研究:在线策略蒸馏可传播后门风险

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Jian Luo 等作者发表论文称,安全对齐但被植入后门的教师模型,可通过在线策略蒸馏(OPD)把隐藏的恶意行为传给原本干净的学生模型。在 3% 投毒率下,蒸馏后学生模型的攻击成功率(ASR)最高达 70%;仅用 10 个投毒样本,训练 16 个 epoch 后 ASR 即达 67%。 论文还称,常用的 top-k KL 会加速后门传播,在多数设置下比 sampled-token KL 更早出现由触发条件引发的不良行为;Lazy Defense 在低投毒率设置下可延迟后门传播。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    安全对齐的 on-policy distillation 会传播后门吗?3% 投毒率即可达 70% 攻击成功率

    研究发现,安全对齐但被植入后门的教师模型可通过 on-policy distillation(OPD)将隐藏恶意行为传给原本干净的学生模型,3% 投毒率下攻击成功率(ASR)最高达 70%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。