arXiv cs.CV· Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne·· 5 小时前AI 评分27
FindIt:面向通用多模态 LLM 的格式感知视觉检测基准
FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs
AI 导读
研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。
来源:arXiv cs.CV · arxiv.org