arXiv cs.CL· Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis, Ruofei Lai, Jeff Z. Pan·· 4 小时前AI 评分24
超越结果奖励:为搜索智能体构建与分配检索信用
Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents
AI 导读
针对搜索智能体依赖稀疏结果奖励、信用分配困难的问题,研究者系统考察了多种奖励塑形与信用分配策略,用中间检索步骤提供学习信号。基于这些发现构建的训练框架将中间信号与最终结果奖励结合,在多个 benchmark 上以匹配训练条件提升了搜索智能体整体表现,并显示中间信号的选择及其信用分配位置都会影响训练行为。
来源:arXiv cs.CL · arxiv.org