跳到正文
arXiv cs.AI· Christopher M. Stewart, Preston Botter, Natalie Sarabosing, Muye Zhang, Rachel Phinnemore, Shalini Ghosh, Hong Shen, Hoda Heidari·· 3 小时前AI 评分22

研究质疑 HELM Safety 能否测量单一"有害拒绝"属性

Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark

AI 导读

一项心理测量学审计发现,HELM Safety 中可能针对"有害拒绝"的四个数据集里有三个已饱和,仅剩的 HarmBench 经多维项目反应理论建模后,强烈显示其并未测量单一属性。差异项目功能分析还发现,来自不同开发者的模型在相同拒绝能力下得分不同,这种差异在按范围匹配后基本消失。研究认为,任何对数据集和题目取平均的安全分数都可能掩盖饱和并混淆不同行为。

来源:arXiv cs.AI · arxiv.org