R-Quest 用问题反馈维持推理模型自进化
热点事件持续更新
R-Quest 用问题反馈维持推理模型自进化
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
针对推理模型反复自训练后性能崩溃的问题,研究者提出 R-Quest 方法:先训练 solver 识别并拒绝无效问题,再用其判断引导提问者奖励并过滤训练数据,同时用冻结基座模型比较问题对以提供新颖性反馈。 该方法在数学推理、通用推理和代码生成共 12 个基准上取得最高平均性能,十轮自我进化中保持稳定增益,最终轮超过 R-Zero 17.32 分。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
推理模型自我进化为何崩溃?R-Quest 用问题有效性与新颖性反馈维持十轮稳定提升报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CL推理模型自我进化为何崩溃?R-Quest 用问题有效性与新颖性反馈维持十轮稳定提升
针对自我进化推理模型反复自训练导致性能崩溃的问题,研究者提出 R-Quest,通过问题有效性与新颖性反馈引导进化:先训练 solver 识别并拒绝无效问题,再用其判断引导提问者奖励并过滤训练数据,同时用冻结基座模型比较问题对以提供新颖性反馈。该方法在数学推理、通用推理和代码生成共 12 个基准上取得最高平均性能,十轮自我进化中保持稳定增益,最终轮超过 R-Zero 17.32 分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。