跳到正文
热点事件持续更新

开放权重模型防御被低成本攻击绕过

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Kevin Kuo 等作者发表论文称,开放权重大语言模型的安全防御可被 abliteration 和 prefilling 两种低成本攻击绕过。在 BeaverTails、HarmBench 和 AdvBench 三个基准上,攻击成功率从不足 10% 升至 16%-96%。 作者指出,这两种攻击策略虽广为人知,但此前未被系统评估过对上述防御的效果。论文同时提出 ART 防御方法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    开放权重 LLM 微调防御易受简单攻击:abliteration 与 prefilling 可绕过安全防护

    开放权重 LLM 的安全防御可被 abliteration 和 prefilling 两种低成本攻击绕过,在 BeaverTails、HarmBench 和 AdvBench 三个基准上,攻击成功率从不足 10% 升至 16%-96%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。