跳到正文
arXiv cs.CV· Zhongyu Yang, Jiale Tao, Ruitao Chen, Zuhao Yang, Yingfang Yuan, Xueliang Zhao, Auden, Kai Wang, Shuai Shao, Biao Wang, Steve Yves, Qinglin Lu·· 3 小时前AI 评分22

OmniCapBench:面向细粒度音视频描述的分层结构化评测框架

OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

AI 导读

OmniCapBench 将音视频描述评测从自由文本改为实体引用、视觉镜头、音频事件三类原子化可验证单元的集合,用确定性约束检查加局部 LLM 语义比较打分。该基准包含 786 段密集标注视频,可区分时序定位失败、身份漂移、跨模态错位和幻觉描述等 MLLM 感知错误。评测显示前沿 MLLM 局部感知强但长时程音视频推理弱,论文已被 NeurIPS 2026 接收。

来源:arXiv cs.CV · arxiv.org