跳到正文
arXiv cs.LG· Michael Alexander Riegler, Finn Schwall, Annika Willoch Olstad, Birk Sebastian Frostelid Torpmann-Hagen, Sushant Gautam, Klas H. Pettersen, Inga Str\"umke·· 6 小时前AI 评分37

限制模型却漏掉系统:攻击性 AI 治理中的测量与问责

Restricting the Model, Missing the System: Measurement and Accountability in Offensive AI Governance

AI 导读

一项研究指出,衡量 AI 攻击能力的工具存在两类失效:夸大危害,以及把属于周边系统的能力记在模型头上。在超 225 次群体生成攻击中,LLM-as-judge 判定 Claude Sonnet 4 在 40% 攻击中被攻破,但人工核验未发现任何可操作有害内容,而 GPT-4o 的有效危害率为 45.8%。

来源:arXiv cs.LG · arxiv.org