arXiv cs.AI· Wonjun Lee, Kyungsik Yang, Gaeun Ji, Vaidehi Patil, Haon Park, Bumsub Ham, Mohit Bansal, Suhyun Kim·· 10 小时前AI 评分24
LADE:利用暗知识中的模型无关潜在安全信号防护 LLM
Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge
AI 导读
研究者提出 LADE,通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,并借助 tokenizer 映射与 kNN 判别实现模型无关的越狱攻击防御。该方法在多种 LLM 和基准上降低了攻击成功率,同时保持有竞争力的安全-效用权衡。
来源:arXiv cs.AI · arxiv.org