跳到正文
热点事件持续更新

研究定位LLaMA-2-7B安全敏感参数

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项针对 LLaMA-2-7B-Chat 的研究发现,该模型的安全敏感行为集中在稀疏的参数子集中,其中 MLP 的 down_proj 是最突出的安全敏感组件。 研究者称,仅修改 down_proj 中 0.19% 的权重,即可使 Basic ASR 达到 53%、GCG ASR 达到 56%,而 tinyBenchmarks 准确率仍为 51.6%,与未修改基线的 52.2% 相差不大。这表明少量参数改动即可显著削弱模型的安全对齐,同时基本不影响常规任务表现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    LLaMA-2-7B-Chat 安全性有多脆弱?定位稀疏故障分析的关键安全参数

    研究针对 LLaMA-2-7B-Chat 发现,安全敏感行为集中在稀疏参数子集中,MLP 的 down_proj 是最突出的安全敏感组件。仅修改 down_proj 中 0.19% 的权重,即可达到 53% Basic ASR 和 56% GCG ASR,而 tinyBenchmarks 准确率仍保持 51.6%(未修改基线为 52.2%)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。