跳到正文
arXiv cs.LG· Yang Liu, Jiaqi Li, Jun Bai, Qianyu Yang, Xiaobo Hu, Tao Peng, Zaiyuan Wang, Ran Tian, Jiayun Dong, Chun Zhang, Zixia Jia, Kaiyuan Chen, Yixin Ren, Yang Liu, Yanglihong Xiao, Lingyue Yin, Tiliang Duan, Ge Zhang, Gang Yao, Hao Chen, Yuan Gong, Jianpeng Jiao, Zilong Zheng·· 3 小时前AI 评分28

$OneMillion-Bench:语言智能体距离人类专家还有多远?

\$OneMillion-Bench: How Far are Language Agents from Human Experts?

AI 导读

研究者推出 $OneMillion-Bench($OMB),一个覆盖法律、金融、工业、医疗和自然科学五大领域的 400 项专家编写任务基准,用于评估语言智能体在经济相关场景中的表现。

来源:arXiv cs.LG · arxiv.org