跳到正文
arXiv cs.LG· Bohan Lin, Liyi Chen, Zhuoning Guo, Muyang Li, Qimeng Wang, Yan Gao, Yao Hu, Yudong Zhang·· 6 小时前AI 评分27

GraphOPD:面向 LLM 智能体的图增强同策略蒸馏

GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents

AI 导读

针对同策略蒸馏按教师-学生分歧大小分配监督信号在多轮智能体任务中失效的问题,研究者提出 GraphOPD,首次将图结构增强引入 LLM 智能体的同策略蒸馏。该方法从环境状态变化记录中构建步骤依赖图,用随机游走平稳分布打分,并与分歧信号融合成轨迹相对掩码。在 ALFWorld、WebShop、SearchQA 上跨三种模型规模和十一个基线测试,最高较最强基线提升 5.8 个百分点。

来源:arXiv cs.LG · arxiv.org