跳到正文
热点事件持续更新

研究者提出OrthoPurify净化后门LVLM

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者提出一种名为 OrthoPurify 的方法,用于净化被植入后门的大型视觉语言模型。该方法通过一步正交投影直接修改模型权重,无需重新训练,也不需要在推理阶段做额外干预。 据作者描述,其原理基于“方向劫持”现象:先用少量干净样本微调预训练权重,得到一个伪良性参考模型,再据此定位并移除被劫持的权重更新方向。实验称该方法可将攻击成功率降至接近零,同时在多个基准上保持原有性能,代码已公开。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CV
    OrthoPurify:通过移除被劫持方向净化后门大型视觉语言模型

    研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的大型视觉语言模型权重,无需重训练或推理时干预。该方法基于"方向劫持"现象,用少量干净样本微调预训练权重得到伪良性参考模型,据此定位并移除被劫持的权重更新方向。实验显示其可将攻击成功率降至接近零,同时在多个基准上保持原有性能,代码已公开。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。