arXiv cs.AI· Yibo Li, Jinhang Qiu, Zhi Zheng, Qianyun Guo, Jiaying Wu, Shuo Ji, Bryan Hooi·· 9 小时前AI 评分37
Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
AI 导读
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。
来源:arXiv cs.AI · arxiv.org