跳到正文
arXiv cs.CL· Hanwen Li, Jinhao Duan, Guanhua Zhu, Junchi Lu, Bo Shen, Chenxi Yuan, Kaidi Xu·· 4 小时前AI 评分29

从不确定性到行动:学习引导 LLM 智能体

From Uncertainty to Action: Learning to Steer LLM Agents

AI 导读

研究者提出 VoS(Value of Steering),一种轨迹级监控器,可从约 82,000 条反事实续写中学习每步引导价值,并据此决定在何处引导 LLM 智能体。在 12 种基准、智能体及离线/在线设置下,VoS 平均提升 7.8 分,并在 11 种设置中平均超出五种现有不确定性触发方法 2.9 分。

来源:arXiv cs.CL · arxiv.org