跳到正文
热点事件观察中

研究:VLM在违反Grice准则的VQA中性能下降

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

一项研究评估了ChatGPT、Claude、Gemini和Llava在视觉问答(VQA)任务中遇到违反Grice准则的提问时的表现,结果显示这些模型的性能均下降。研究通过给提问添加非必要、歧义或虚假信息来制造违规。 研究还对比了人类与VLM的语用推理差异:人类解决VLM诱导的违规时认知投入更低,但VLM自身在这类情况下的准确率更差。研究同时考察了VLM处理人类诱导违规与AI生成违规时的推理差异。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CL
    研究评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则的 VQA 任务中的表现

    一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。