arXiv cs.AI· Wei Yang, Shawn Li, Yuehan Qin, Yawei Wang, Mingxi Wang, Shixuan Li, Tiankai Yang, Jiate Li, Jesse Thomason, Xuezhe Ma, Yue Zhao·· 3 小时前AI 评分27
SynCo:基于多智能体强化学习的数据合成协同训练框架,让 LLM 自我进化
SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning
AI 导读
研究者提出 SynCo,一个基于多智能体强化学习的智能体数据合成协同训练框架,用于自我进化的 LLM。它联合优化两个独立参数化的智能体:Synthesizer 根据 Reasoner 不断变化的能力状态构造训练任务,Reasoner 则从生成的经验中学习,二者通过多次 rollout 的结果获得互补奖励并共同更新。
来源:arXiv cs.AI · arxiv.org