跳到正文
热点事件持续更新

研究:CLIP提示边际安全分数反映相似度而非危险

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项针对冻结 CLIP 提示词边际安全分数的受控评估发现,该分数在接触前约二十步开始下降,但主要反映的是场景与其提示词描述的相似度,而非危险本身。研究由 Samuel Tetteh 和 Cody Fleming 发表。 评估覆盖三个策略、180 条轨迹和 130 次孤立接触起始,分数随提示词区分度和相机视角变化。恒定置信度对照组仍保留较低的灾难率点估计,研究者据此称策略收益并不能证明模型感知到了危险。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CV
    冻结视觉语言安全分数并非识别危险:一项针对 CLIP 提示词边际分数的受控评估

    研究对冻结 CLIP 提示词边际安全分数做了受控评估,发现该分数在接触前约二十步开始下降,但主要反映的是场景与其提示词描述的相似度,而非危险本身。在三个策略、180 条轨迹和 130 次孤立接触起始上,分数随提示词区分度和相机视角变化;恒定置信度对照组仍保留较低的灾难率点估计,说明策略收益并不能证明模型感知到了危险。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。