跳到正文
arXiv cs.AI· Xingang Guo, Jing Gu, Brian Jang, Renxiong Wang, Utkarsh Tyagi, Daniel Quigley, Steven Li, David Yan, Daniel Yue Zhang, Darvin Yi, Forrest Huang, HiJae Kim, Tianyi Zhang, Jared Lichtarge, Jihua Huang, Le Xue, Manan Tomar, Qiuyi Richard Zhang, Ruofei Yu, Seth Neel, Yaning Hu, Marcella Valentine, Xinzhe Jiang, Daniel Evans, Chenguang Wang, Dustin Tran, Tong Zhao, Yinfei Yang, Yunzhong He·· 3 小时前AI 评分37

Humanity's Sixth Sense:多模态模型直觉视觉推理基准测试

Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models

AI 导读

研究者推出 Humanity's Sixth Sense(HSS)基准,用于评测多模态大模型的直觉视觉推理能力,涵盖图像与视频输入,按结构化分类组织并配有人工撰写的提示词。测试显示人类参与者准确率达 93.1%,而最强模型 GPT-6-astra 即使开启最大推理力度也仅 53.6%。研究还探索了动态视觉操作的智能体方案,能缩小但无法弥合这一差距。

来源:arXiv cs.AI · arxiv.org