跳到正文
arXiv cs.LG· Mohnish Harwani, Yujia Zheng·· 6 小时前AI 评分24

顺序预训练更有利于大模型:Exposure Therapy 正则化改善小模型能力

Sequential Pretraining Favors Large Models

AI 导读

研究发现大模型的能力优势部分源于对"首因偏差"的鲁棒性——小模型会把学习容量低效分配给早期数据分布,导致难以学好训练后期出现的代码、数学和推理等能力。为此作者提出 Exposure Therapy(ET)正则化方法,在顺序预训练中促进学习容量更高效分配,在十亿参数规模以内的模型上提升了后期数据分布表现和整体能力。

来源:arXiv cs.LG · arxiv.org