跳到正文
热点事件持续更新

GraphOPD:图增强在线策略蒸馏方法

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者提出 GraphOPD,首次将图结构增强引入大语言模型智能体的同策略蒸馏。该方法针对按教师-学生分歧大小分配监督信号在多轮智能体任务中失效的问题,从环境状态变化记录中构建步骤依赖图,用随机游走平稳分布打分,再与分歧信号融合成轨迹相对掩码。 在 ALFWorld、WebShop、SearchQA 三个任务上,跨三种模型规模和十一个基线测试,GraphOPD 最高较最强基线提升 5.8 个百分点。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    GraphOPD:面向 LLM 智能体的图增强同策略蒸馏

    针对同策略蒸馏按教师-学生分歧大小分配监督信号在多轮智能体任务中失效的问题,研究者提出 GraphOPD,首次将图结构增强引入 LLM 智能体的同策略蒸馏。该方法从环境状态变化记录中构建步骤依赖图,用随机游走平稳分布打分,并与分歧信号融合成轨迹相对掩码。在 ALFWorld、WebShop、SearchQA 上跨三种模型规模和十一个基线测试,最高较最强基线提升 5.8 个百分点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。