跳到正文
arXiv cs.CL· Muhammad Zeeshan Karamat, Christiana Chamon Garcia·· 4 小时前AI 评分33

LLaMA-2-7B-Chat 安全性有多脆弱?定位稀疏故障分析的关键安全参数

How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis

AI 导读

研究针对 LLaMA-2-7B-Chat 发现,安全敏感行为集中在稀疏参数子集中,MLP 的 down_proj 是最突出的安全敏感组件。仅修改 down_proj 中 0.19% 的权重,即可达到 53% Basic ASR 和 56% GCG ASR,而 tinyBenchmarks 准确率仍保持 51.6%(未修改基线为 52.2%)。

来源:arXiv cs.CL · arxiv.org