跳到正文
arXiv cs.CL· Xilin Jiang, Qiaolin Wang, Junkai Wu, Xiaomin He, Zhongweiyang Xu, Yinghao Ma, Minshuo Piao, Kaiyi Yang, Xiuwen Zheng, Riki Shimizu, Yicong Chen, Arsalan Firoozi, Gavin Mischler, Sukru Samet Dindar, Richard Antonello, Linyang He, Tsun-An Hsieh, Xulin Fan, Yulun Wu, Yuesheng Ma, Chaitanya Amballa, Weixiong Chen, Jiarui Hai, Ruisi Li, Vishal Choudhari, Cong Han, Yinghao Aaron Li, Adeen Flinker, Mounya Elhilali, Emmanouil Benetos, Mark Hasegawa-Johnson, Romit Roy Choudhury, Nima Mesgarani·· 9 小时前AI 评分29

AVMeme Exam:面向 LLM 语境与文化理解的多模态多语言多文化基准

AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

AI 导读

研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。

来源:arXiv cs.CL · arxiv.org