跳到正文
热点事件持续更新

研究对比RL与SFT教师用于OPD模型合并

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

一项新研究对比了监督微调(SFT)与强化学习(RL)两种训练算法产出的教师模型,在 on-policy distillation(OPD)模型合并中的效果。研究由 Jingyuan Huang 等作者发表,教师与学生模型均基于 Qwen3.5-9B 初始化,并在 Agentic、Reasoning、Perception 三类任务上做受控单教师对比。 研究要回答的问题是:哪种训练算法产生的教师更适合 OPD。报道未给出哪种教师更优的结论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    Train4Merge:RL 与 SFT 教师用于 OPD 模型合并的受控单教师对比研究

    研究对比了 SFT 与 RL 两种训练算法产出的教师模型在 on-policy distillation(OPD)模型合并中的效果,教师与学生均基于 Qwen3.5-9B 初始化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。