arXiv cs.CV· Samuel Tetteh, Cody Fleming·· 4 小时前AI 评分26
冻结视觉语言安全分数并非识别危险:一项针对 CLIP 提示词边际分数的受控评估
It Is Not Seeing the Hazard: A Frozen Vision-Language Safety Score Measures Its Caption Bank
AI 导读
研究对冻结 CLIP 提示词边际安全分数做了受控评估,发现该分数在接触前约二十步开始下降,但主要反映的是场景与其提示词描述的相似度,而非危险本身。在三个策略、180 条轨迹和 130 次孤立接触起始上,分数随提示词区分度和相机视角变化;恒定置信度对照组仍保留较低的灾难率点估计,说明策略收益并不能证明模型感知到了危险。
来源:arXiv cs.CV · arxiv.org