跳到正文
热点事件持续更新

研究:LLM智能体难以遵守时间预算

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

一项新研究评估了小 LLM 智能体在明确时间预算下的表现,发现仅靠提示词告知预算时,智能体无法控制自己的用时。 研究测试了 Qwen3.6-27B 在 MLE-Bench Lite 五项竞赛、Qwen3-4B 在 Zork I 上的表现。作者称,通过 harness 注入计时信息可显著提升 Qwen3.6-27B 的预算遵守度且不损失性能;在 Zork I 上使用 GRPO 强化学习实现了近乎完美的预算遵守,并能泛化到未见过的预算。 但研究同时发现,智能体仍无法利用额外时间提升任务表现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.LG
    研究:小 LLM 智能体在时间预算下的准时与高效表现

    研究评估 Qwen3.6-27B 在 MLE-Bench Lite 五项竞赛、Qwen3-4B 在 Zork I 上的时间预算表现,发现仅靠提示词说明预算时智能体无法控制用时。通过 harness 注入计时信息可显著提升 Qwen3.6-27B 的预算遵守度且不损失性能,GRPO 强化学习在 Zork I 上实现近乎完美的预算遵守并泛化到未见预算,但智能体仍无法用额外时间提升任务表现。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。