arXiv cs.AI· Zhiyi Li, Sihan Hu, Tianning Xiao, Xiansheng Cai, Xiaojun Tan, Youjin Deng, Kun Chen·· 3 小时前AI 评分27
OpenProblemBench:在基础理论科学开放问题上评测 AI
OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences
AI 导读
OpenProblemBench 是一个包含 82 个数学与理论物理未解问题的基准,每题提供研究背景、假设与已有进展,并由四个评估模型在无参考答案的情况下独立判断解答的正确性、完整性与推进程度。在七种评测配置中,GPT-6-Astra 取得最高平均判定解决率 14.0%,完整规模开源模型为 5.5-6.7%,Flash 模型为 2.4-3.7%。
来源:arXiv cs.AI · arxiv.org