跳到正文
arXiv cs.AI· Heewon Park, Somin Im, Minhae Kwon·· 10 小时前AI 评分37

SAG:面向长程决策的成本感知 LLM 智能体选择性批评框架

Selective Critique for Cost-Aware LLM Agents in Long-Horizon Decision Making

AI 导读

研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。

来源:arXiv cs.AI · arxiv.org