跳到正文
arXiv cs.LG· Domenic Rosati, Alessa Carbo, Ali Dadsetan, Hong Huang, Matthew Young, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad·· 6 小时前AI 评分24

移除信息量并不能证明开放权重模型的抗篡改能力

Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models

AI 导读

开放权重模型仅靠移除有害信息,无法普遍保证其抵抗微调攻击。研究表明,保函数的重参数化不改变互信息却会改变梯度下降几何,使基于互信息的不变量证书受限于最快可达的参数化路径。实验显示,训练顺序可在权重-数据互信息固定时改变恢复时间,且存在一种构造使两类互信息均为零却能在一步梯度更新后恢复。

来源:arXiv cs.LG · arxiv.org