跳到正文
热点事件持续更新

研究者推出FindIt多模态定位检测基准

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

研究者 Eshika Khandelwal 等人发布 FindIt,称其为首个系统评估通用多模态大模型(MLLM)可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制模型输出可解析的边界框,并定义透明的评测协议。 对多种开源与闭源 MLLM 的评测显示,当前模型对输出格式约束高度敏感,即使格式轻微变化也常难以泛化。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CV
    FindIt:面向通用多模态 LLM 的格式感知视觉检测基准

    研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。