arXiv cs.CL· Tianle Wang, Jiayu Liu, Ruizhi Zhao, Ning Miao·· 4 小时前AI 评分26
SAPD:步对齐特权蒸馏,无需 rollout 的离线后训练方法
SAPD: Step-Aligned Privileged Distillation
AI 导读
SAPD 是一种无需 rollout 的自蒸馏方法,将固定演示转化为步对齐的分布监督,用参考解的已知进展为每个推理步骤提供针对性特权指导。在数学推理基准上,其平均表现优于监督微调和标签平滑,与同策略强化学习及自蒸馏相当,并保留域外代码能力,训练循环速度约为同策略基线的 2 倍。
来源:arXiv cs.CL · arxiv.org