跳到正文
arXiv cs.CL· Ming Zhang, Zhenghao Xiang, Peizhong Gao, Yujiong Shen, Yuhui Wang, Zhonghan Yue, Shihan Dou, Zhangyue Yin, Junjie Ye, Shichun Liu, Weihuang Zheng, Jiahao Chen, Jiayi Chen, Hongzhang Liu, Jiaqi Shao, Tao Gui, Qi Zhang, Xuanjing Huang, Suncong Zheng, Maxm Pan·· 3 小时前AI 评分27

ExplorationBench:在可验证的 Alien Worlds 中测量 AI 系统的探索能力

ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

AI 导读

研究者推出 ExplorationBench,用规则可执行、与已知知识冲突的 Alien Worlds 评估 AI 系统的科学探索能力,包含 AlienCode(31 个发现目标、70 个任务)和 AlienLogic(24 个发现目标、70 个任务)两个沙盒。对 10 个 AI 系统的评测显示,最强系统能习得并应用陌生规则,但表现随轨迹差异显著,持续探索可能停滞甚至逆转此前的进展。

来源:arXiv cs.CL · arxiv.org