arXiv cs.LG· Indranil Halder, Annesya Banerjee, Cengiz Pehlevan·· 3 小时前AI 评分29
大语言模型的越狱缩放定律:从多项式到指数级跨越
Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover
AI 导读
研究发现,对抗性提示注入攻击可将大语言模型的攻击成功率从无注入时的多项式增长放大为随推理采样次数呈指数增长。作者提出基于自旋玻璃模型的理论生成框架,短注入提示对应弱磁场并产生幂律缩放,长注入提示对应强磁场并产生指数缩放。该趋势在 3B 至 70B 参数规模的多种模型、GCG 与 AutoDAN 攻击方法及 AdvBench、HarmBench 基准上保持稳定。
来源:arXiv cs.LG · arxiv.org