跳到正文
arXiv cs.CV· Zheyu Fan, Yue Zhang, Mingkai Deng, Kangrui Wang, Qineng Wang, Canyu Chen, Jie Hao, Xing Fan, Chenlei Guo, Eric P. Xing, Mohit Bansal, Manling Li·· 3 小时前AI 评分37

WOVEN:将视觉世界建模融入多模态大语言模型

WOVEN: Weaving Visual World Modeling into Multimodal LLMs

AI 导读

研究者提出 WOVEN,一个按场景、动作和推理类型组织视觉转换监督的训练源与基准,包含 36,076 个样本、20 种场景、5 种动作和 8 种推理类型。对 38 个前沿 MLLM(如 GPT-5.4、Qwen3-VL-235B-A22B)的评测显示其视觉转换推理能力远低于人类。

来源:arXiv cs.CV · arxiv.org