arXiv cs.CV· Bojun Yang, Haochen Zhou, Zhifang Zhang, Haobo Wang, Songze Li, Lei Feng·· 4 小时前AI 评分22
OrthoPurify:通过移除被劫持方向净化后门大型视觉语言模型
Purifying Backdoored Large Vision-Language Models by Removing Hijacked Directions
AI 导读
研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的大型视觉语言模型权重,无需重训练或推理时干预。该方法基于"方向劫持"现象,用少量干净样本微调预训练权重得到伪良性参考模型,据此定位并移除被劫持的权重更新方向。实验显示其可将攻击成功率降至接近零,同时在多个基准上保持原有性能,代码已公开。
来源:arXiv cs.CV · arxiv.org