arXiv cs.LG· Aaron Wang, Neelabh Madan, Vlad Sobal, Matthew Trager, Michael Kleinman, Elman Mansimov, Wei Xia, Stefano Soatto·· 3 小时前AI 评分32
研究:小 LLM 智能体在时间预算下的准时与高效表现
On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents
AI 导读
研究评估 Qwen3.6-27B 在 MLE-Bench Lite 五项竞赛、Qwen3-4B 在 Zork I 上的时间预算表现,发现仅靠提示词说明预算时智能体无法控制用时。通过 harness 注入计时信息可显著提升 Qwen3.6-27B 的预算遵守度且不损失性能,GRPO 强化学习在 Zork I 上实现近乎完美的预算遵守并泛化到未见预算,但智能体仍无法用额外时间提升任务表现。
来源:arXiv cs.LG · arxiv.org