研究:LLM智能体难以遵守时间预算
热点事件持续更新
研究:LLM智能体难以遵守时间预算
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
一项新研究评估了小 LLM 智能体在明确时间预算下的表现,发现仅靠提示词告知预算时,智能体无法控制自己的用时。 研究测试了 Qwen3.6-27B 在 MLE-Bench Lite 五项竞赛、Qwen3-4B 在 Zork I 上的表现。作者称,通过 harness 注入计时信息可显著提升 Qwen3.6-27B 的预算遵守度且不损失性能;在 Zork I 上使用 GRPO 强化学习实现了近乎完美的预算遵守,并能泛化到未见过的预算。 但研究同时发现,智能体仍无法利用额外时间提升任务表现。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
研究:小 LLM 智能体在时间预算下的准时与高效表现报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.LG研究:小 LLM 智能体在时间预算下的准时与高效表现
研究评估 Qwen3.6-27B 在 MLE-Bench Lite 五项竞赛、Qwen3-4B 在 Zork I 上的时间预算表现,发现仅靠提示词说明预算时智能体无法控制用时。通过 harness 注入计时信息可显著提升 Qwen3.6-27B 的预算遵守度且不损失性能,GRPO 强化学习在 Zork I 上实现近乎完美的预算遵守并泛化到未见预算,但智能体仍无法用额外时间提升任务表现。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。