arXiv cs.CV· Ross Callaghan, Niannu Gao, Hojjat Azadbakht, Hui Zhang·· 5 小时前AI 评分39
医学图像对齐评估成为前沿多模态模型通用视觉推理测试:GPT-6 准确率超 85%
Medical Image Alignment Assessment as a Test of Generalist Visual Reasoning in Frontier Multimodal Models
AI 导读
研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。
来源:arXiv cs.CV · arxiv.org