arXiv cs.CV· Huiyao Zhang, Jin Bai, Zilong Su, Rui Guo, Chaofan Qin, Jinze Lv, Wenhui Yu, Hongfei Wang, Ye Li·· 4 小时前AI 评分22
CROSS-Bench:评估与控制视觉语言模型决策层证据使用
Visual Evidence Under Cross-Examination: Evaluating and Controlling Decision-Level Evidence Use in Vision-Language Models
AI 导读
研究者提出 CROSS-Bench,一个包含 28,000 个决策问题的基准,通过匹配的失效与重绑定测试考察视觉语言模型的候选绑定证据使用。其 RIVET 接口在干净证据有效时将归一化效应转移从 0.512 提升至 0.651,并在四个冻结骨干模型上将 CROSS-Bench 准确率平均提升 5.70 pp。结果表明任务准确率与证据归属可能分离。
来源:arXiv cs.CV · arxiv.org