arXiv cs.AI· Xi Qin, Isabel Kurth, Xin Cui, Elin Park, Alexander Schaefer, Yaad Oren·· 1 天前AI 评分31
用 Claude Opus 生成终端任务训练智能体为何停滞:数据生成与验证挑战解析
When Terminal-Agent Training Stalls: Demystifying Data Generation and Verification Challenge
AI 导读
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
来源:arXiv cs.AI · arxiv.org