arXiv cs.CL· Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal·· 1 天前AI 评分22
研究评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则的 VQA 任务中的表现
Evaluating VQA in Vision Language Models using Cooperative Principles
AI 导读
一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。
来源:arXiv cs.CL · arxiv.org