arXiv cs.CL· Anna Mosolova, Djam\'e Seddah·· 4 小时前AI 评分31
TriviaRoomQA:多语言 LLM 的日常知识盲区评测基准
When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs
AI 导读
研究者推出 TriviaRoomQA,一个覆盖 288 个主题的多语言基准,含 6 种欧洲语言的 3,300 道平行选择题及 5,340 道法语专属题,用于评测 LLM 的日常、文化及长尾知识。对 30 个 7B 至 70B 参数的开源模型测试显示,模型在历史、地理、数学等知识密集型主题上表现强劲,但在名人、音乐、电影、新闻等日常流行文化主题上明显偏弱,且同一问题在不同语言下表现不一。
来源:arXiv cs.CL · arxiv.org