跳到正文
arXiv cs.CL· Jinyuan Li, Chengsong Huang, Langlin Huang, Donghong Cai, Shiping Gao, Yuyi Yang, Jiaxin Huang·· 4 小时前AI 评分31

推理模型自我进化为何崩溃?R-Quest 用问题有效性与新颖性反馈维持十轮稳定提升

Questioning the Questions: Sustaining Self-Evolution in Reasoning Models

AI 导读

针对自我进化推理模型反复自训练导致性能崩溃的问题,研究者提出 R-Quest,通过问题有效性与新颖性反馈引导进化:先训练 solver 识别并拒绝无效问题,再用其判断引导提问者奖励并过滤训练数据,同时用冻结基座模型比较问题对以提供新颖性反馈。该方法在数学推理、通用推理和代码生成共 12 个基准上取得最高平均性能,十轮自我进化中保持稳定增益,最终轮超过 R-Zero 17.32 分。

来源:arXiv cs.CL · arxiv.org