研究定位LLaMA-2-7B安全敏感参数
热点事件持续更新
研究定位LLaMA-2-7B安全敏感参数
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一项针对 LLaMA-2-7B-Chat 的研究发现,该模型的安全敏感行为集中在稀疏的参数子集中,其中 MLP 的 down_proj 是最突出的安全敏感组件。 研究者称,仅修改 down_proj 中 0.19% 的权重,即可使 Basic ASR 达到 53%、GCG ASR 达到 56%,而 tinyBenchmarks 准确率仍为 51.6%,与未修改基线的 52.2% 相差不大。这表明少量参数改动即可显著削弱模型的安全对齐,同时基本不影响常规任务表现。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
LLaMA-2-7B-Chat 安全性有多脆弱?定位稀疏故障分析的关键安全参数报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CLLLaMA-2-7B-Chat 安全性有多脆弱?定位稀疏故障分析的关键安全参数
研究针对 LLaMA-2-7B-Chat 发现,安全敏感行为集中在稀疏参数子集中,MLP 的 down_proj 是最突出的安全敏感组件。仅修改 down_proj 中 0.19% 的权重,即可达到 53% Basic ASR 和 56% GCG ASR,而 tinyBenchmarks 准确率仍保持 51.6%(未修改基线为 52.2%)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。