arXiv cs.AI· Vincent Siu, Glenn Grant-Richards, Vlad Pavlovich, Yizhou Sun, Dawn Song, Chenguang Wang·· 10 小时前AI 评分24
Transformer 拒绝机制中的组件与维度稀疏性
Component and Dimension Sparsity in Transformer Refusal Mechanisms
AI 导读
研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。
来源:arXiv cs.AI · arxiv.org