跳到正文
arXiv cs.AI· Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Qi Wen, Pengfei Zhou, Wangbo Zhao, Ivor Tsang·· 9 小时前AI 评分29

校准不等于控制:面向 LLM 智能体监督的干预价值

Calibration Is Not Control: Intervention Value for LLM-Agent Oversight

AI 导读

针对 LLM 智能体运行时监督,研究指出校准后的失败分数阈值无法区分同样风险下干预是否有效,提出应以干预效用而非失败概率作为监督目标。在 ALFWorld 上固定特征、估计器与路由器,仅将监督目标从失败改为干预效用,regret 从 0.51 降至 0.09。在 300 个未见任务上,冻结前缀特征控制器相比失败触发路由将交接率从 48% 降至 35%,成功率从 37% 提升至 45%。

来源:arXiv cs.AI · arxiv.org