跳到正文
arXiv cs.CL· Xiaoshu Chen, Sihang Zhou, Ke Liang, Xinwang Liu·· 4 小时前AI 评分24

SeOPD:通过自生成 CoT 在线策略蒸馏实现自我进化的 LLM

SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought

AI 导读

研究者提出 SeOPD,让 LLM 无需外部特权信息即可自我提升:先用深度思考模式生成 CoT,再用非思考模式生成回答,并将 CoT 作为特权信息对回答做 token 级监督,使推理中产生的新信息内化进共享模型参数。实验表明该方法同时提升了非思考与深度思考能力。

来源:arXiv cs.CL · arxiv.org