arXiv cs.CL· Taehoon Kim, Seunggeun Cho, Dongsu Han·· 4 小时前AI 评分24
CRD:跨反馈与连贯策展的协作推理蒸馏框架
Collaborative Reasoning Distillation via Cross-Feedback and Coherent Curation
AI 导读
研究者提出协作推理蒸馏(CRD)框架,通过教师模型交互式交叉反馈、细粒度逐步质量评估和连贯感知步骤拼接三项创新,将推理能力蒸馏到小模型。基于该框架训练的 CRD-4B 在 MATH-500 上达 97.3%、AIME'25 上达 70.3%,仅用 50K 训练样本,数据集规模比同类模型小最多 12 倍。
来源:arXiv cs.CL · arxiv.org