跳到正文
arXiv cs.AI· Faezeh Dehghan Tarzjani, Mevan Wijewardena, Alexander Romanus, Sampad Mohanty·· 11 小时前AI 评分27

从局部证据到安全判定:视觉语言模型中的因果追踪

From Local Evidence to Safety Verdicts: Causal Tracing in Vision-Language Models

AI 导读

研究提出 SSU-Bench 数据集,用单项提示词编辑或图像编辑构造配对的安全与不安全图文组合,并在三个视觉语言模型间迁移内部状态以测量安全判定变化。结果显示,针对被改动输入位置的干预在解码器较早层有效,而针对最终输入 token 的干预在较晚层才生效;最终 token 状态的线性读出还能预测模型自身判定(包括错误判定),跨模型对比显示反事实变化模式存在相似性。

来源:arXiv cs.AI · arxiv.org