跳到正文
热点事件持续更新

研究者发布CROSS-Bench基准与RIVET接口

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者提出 CROSS-Bench 基准与 RIVET 接口,用于评估和控制视觉语言模型在决策层对候选绑定证据的使用。CROSS-Bench 包含 28,000 个决策问题,并在专门评估子集上设置匹配的失效与重绑定测试。 据研究者称,在干净证据有效时,RIVET 将归一化效应转移从 0.512 提升至 0.651,并在四个冻结骨干模型上把 CROSS-Bench 准确率平均提升 5.70 个百分点。研究者表示,结果表明任务准确率与证据归属可能分离。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CV
    CROSS-Bench:评估与控制视觉语言模型决策层证据使用

    研究者提出 CROSS-Bench,一个包含 28,000 个决策问题的基准,通过匹配的失效与重绑定测试考察视觉语言模型的候选绑定证据使用。其 RIVET 接口在干净证据有效时将归一化效应转移从 0.512 提升至 0.651,并在四个冻结骨干模型上将 CROSS-Bench 准确率平均提升 5.70 pp。结果表明任务准确率与证据归属可能分离。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。