arXiv cs.CL· Yekun Chai, Qiwei Peng, Haoyi Xiong·· 1 天前AI 评分36
XiangqiBench:面向 LLM 智能体闭环评估的中国象棋基准
Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents
AI 导读
研究者推出 XiangqiBench,一个可执行的中国象棋基准,用 119 个战术残局让 LLM 智能体在引擎防守下完成将杀,并记录了 12 个前沿 LLM 在两种观测协议下的 8,568 条多轮轨迹。
来源:arXiv cs.CL · arxiv.org