跳到正文
arXiv cs.AI· Sayak Chakrabarti, Sathish Reddy Indurthi·· 9 小时前AI 评分24

RELACE:面向长程语言智能体的基于回顾似然的动作信用估计

RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

AI 导读

RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。

来源:arXiv cs.AI · arxiv.org