arXiv cs.CV· Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu·· 5 小时前AI 评分31
未学习扩散模型的可解释 token 线性几何:越狱攻击与防御
The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models
AI 导读
研究者发现,被遗忘的扩散模型概念会在 token 嵌入空间中留下可解释的线性残差,据此提出越狱攻击 SubAttack 与防御机制 SubDefense。
来源:arXiv cs.CV · arxiv.org