arXiv cs.CL· Kaisen Yang, Qingle Liu, Kejin Wang, Yicheng Zhao, Jieming Li, Shenghan Zheng, Ruize Yang, Bojun Yang, Heng Gong, Xiang Gao, Lanyue Zhang, Kaiyu Zhong, Zhuo Liu, Shaoxuan Li, Chengxi Li, Yong Yan, Weixuan Zhang, Tianwei Luo, Situ Wang, Youjie Zheng, Sihan Zhao, Shengyuan Wang, Huan-ang Gao, Jiazheng Xu, Xiaohui Xie, Wentao Han, Hongning Wang·· 3 小时前AI 评分30
AI 智能体能否在长期游戏竞赛中学会登顶?AAArena 基准评估启发式学习
Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition
AI 导读
研究者提出 Adversarial Heuristic Learning(AHL)范式,让 AI 智能体在固定模型权重下通过修改可执行策略来学习对抗游戏,并发布包含 12 款对抗游戏和 1,920 个存档人类程序的 AAArena 基准。在评估的多种模型与工具配置中,Opus5.5 搭配 Claude Code 拿下 6 枚金牌,但其余 6 个人类天梯无人登顶,规则越复杂的游戏表现越弱。
来源:arXiv cs.CL · arxiv.org