跳到正文
热点事件持续更新

R-Quest 用问题反馈维持推理模型自进化

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

针对推理模型反复自训练后性能崩溃的问题,研究者提出 R-Quest 方法:先训练 solver 识别并拒绝无效问题,再用其判断引导提问者奖励并过滤训练数据,同时用冻结基座模型比较问题对以提供新颖性反馈。 该方法在数学推理、通用推理和代码生成共 12 个基准上取得最高平均性能,十轮自我进化中保持稳定增益,最终轮超过 R-Zero 17.32 分。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    推理模型自我进化为何崩溃?R-Quest 用问题有效性与新颖性反馈维持十轮稳定提升

    针对自我进化推理模型反复自训练导致性能崩溃的问题,研究者提出 R-Quest,通过问题有效性与新颖性反馈引导进化:先训练 solver 识别并拒绝无效问题,再用其判断引导提问者奖励并过滤训练数据,同时用冻结基座模型比较问题对以提供新颖性反馈。该方法在数学推理、通用推理和代码生成共 12 个基准上取得最高平均性能,十轮自我进化中保持稳定增益,最终轮超过 R-Zero 17.32 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。