跳到正文
arXiv cs.LG· Kevin Kuo, Virginia Smith, Chhavi Yadav·· 6 小时前AI 评分36

开放权重 LLM 微调防御易受简单攻击:abliteration 与 prefilling 可绕过安全防护

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

AI 导读

开放权重 LLM 的安全防御可被 abliteration 和 prefilling 两种低成本攻击绕过,在 BeaverTails、HarmBench 和 AdvBench 三个基准上,攻击成功率从不足 10% 升至 16%-96%。

来源:arXiv cs.LG · arxiv.org