跳到正文
arXiv cs.LG· Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky·· 6 小时前AI 评分51

研究:恶意微调防御为何在持续训练下失效

A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

AI 导读

arXiv 论文调查了 15 种针对恶意微调的防御方法,发现它们都建立在有限攻击者假设之上,权重发布后没有任何机制维持保护。作者在 4 个开放权重模型上对 6 种代表性防御继续做 3 个 epoch 的纯有害数据微调,72 次受防御训练结束时模型的有害性都高于发布时,Llama-3.1 在最高学习率下受防御模型的有害性几乎与无防御模型相当。

来源:arXiv cs.LG · arxiv.org