arXiv cs.LG· Kevin Kuo, Virginia Smith, Chhavi Yadav·· 6 小时前AI 评分36
开放权重 LLM 微调防御易受简单攻击:abliteration 与 prefilling 可绕过安全防护
Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
AI 导读
开放权重 LLM 的安全防御可被 abliteration 和 prefilling 两种低成本攻击绕过,在 BeaverTails、HarmBench 和 AdvBench 三个基准上,攻击成功率从不足 10% 升至 16%-96%。
来源:arXiv cs.LG · arxiv.org