跳到正文
热点事件持续更新

研究:恶意微调防御在持续训练下失效

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

一项 arXiv 论文研究称,现有针对恶意微调的防御方法都建立在“攻击者能力有限”的假设上,权重发布后没有任何机制维持保护。作者在 4 个开放权重模型上,对 6 种代表性防御继续用纯有害数据微调 3 个 epoch,72 次受防御训练结束时模型的有害性都高于发布时;Llama-3.1 在最高学习率下,受防御模型的有害性几乎与无防御模型相当。 该研究调查了 15 种防御方法,结论是这些防御无法抵御发布后最简单的持续训练升级。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    研究:恶意微调防御为何在持续训练下失效

    arXiv 论文调查了 15 种针对恶意微调的防御方法,发现它们都建立在有限攻击者假设之上,权重发布后没有任何机制维持保护。作者在 4 个开放权重模型上对 6 种代表性防御继续做 3 个 epoch 的纯有害数据微调,72 次受防御训练结束时模型的有害性都高于发布时,Llama-3.1 在最高学习率下受防御模型的有害性几乎与无防御模型相当。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。