跳到正文
arXiv cs.CL· Yekun Chai, Qiwei Peng, Haoyi Xiong·· 1 天前AI 评分36

XiangqiBench:面向 LLM 智能体闭环评估的中国象棋基准

Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents

AI 导读

研究者推出 XiangqiBench,一个可执行的中国象棋基准,用 119 个战术残局让 LLM 智能体在引擎防守下完成将杀,并记录了 12 个前沿 LLM 在两种观测协议下的 8,568 条多轮轨迹。

来源:arXiv cs.CL · arxiv.org