研究者提出OrthoPurify净化后门LVLM
热点事件持续更新
研究者提出OrthoPurify净化后门LVLM
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究者提出一种名为 OrthoPurify 的方法,用于净化被植入后门的大型视觉语言模型。该方法通过一步正交投影直接修改模型权重,无需重新训练,也不需要在推理阶段做额外干预。 据作者描述,其原理基于“方向劫持”现象:先用少量干净样本微调预训练权重,得到一个伪良性参考模型,再据此定位并移除被劫持的权重更新方向。实验称该方法可将攻击成功率降至接近零,同时在多个基准上保持原有性能,代码已公开。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
OrthoPurify:通过移除被劫持方向净化后门大型视觉语言模型报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CVOrthoPurify:通过移除被劫持方向净化后门大型视觉语言模型
研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的大型视觉语言模型权重,无需重训练或推理时干预。该方法基于"方向劫持"现象,用少量干净样本微调预训练权重得到伪良性参考模型,据此定位并移除被劫持的权重更新方向。实验显示其可将攻击成功率降至接近零,同时在多个基准上保持原有性能,代码已公开。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。