arXiv cs.CV· Jinchang Zhang, Guoyu Lu·· 1 天前AI 评分27
多模态大模型为何"看得见却说得出用不上":SpaceConflict 基准与 OSS 监督方法
Seeing, Saying, but Not Using: From Reportable Spatial Facts to Usable States in Multimodal Large Language Models
AI 导读
多模态大模型能正确报告空间事实,却未必在后续推理中使用该事实。研究者提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 局部事实绑定到 L4 变换下状态判断四个层级,揭示"可用性—利用率"鸿沟:Qwen3.5-9B 在 100 条正确恢复初始状态的序列中有 50 条无法完成完整变换,显式提供状态可修复全部 50 条。
来源:arXiv cs.CV · arxiv.org