论文:移除信息量不能证明开放权重模型抗篡改
热点事件持续更新
论文:移除信息量不能证明开放权重模型抗篡改
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
一篇 arXiv 论文指出,开放权重模型仅靠移除有害信息,无法普遍保证其抵抗微调攻击。作者 Domenic Rosati 等称,发布时的互信息本身不能普遍证明模型被篡改后恢复缓慢。 论文给出的机制是:保函数的重参数化不改变互信息,却会改变梯度下降的几何,使基于互信息的不变量证书受限于最快可达的参数化路径。实验显示,在权重-数据互信息固定时,训练顺序仍能改变恢复时间;论文还构造出一种情形,两类互信息均为零,但模型在一步梯度更新后即可恢复。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
移除信息量并不能证明开放权重模型的抗篡改能力报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LG移除信息量并不能证明开放权重模型的抗篡改能力
开放权重模型仅靠移除有害信息,无法普遍保证其抵抗微调攻击。研究表明,保函数的重参数化不改变互信息却会改变梯度下降几何,使基于互信息的不变量证书受限于最快可达的参数化路径。实验显示,训练顺序可在权重-数据互信息固定时改变恢复时间,且存在一种构造使两类互信息均为零却能在一步梯度更新后恢复。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。