跳到正文
arXiv cs.CL· Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas-Hinostroza, Mattia Nee, Eliot Krzystof Jones, Ir\`ene Girard, David Mach, Anastasia Stasenko, Ivan P. Yamshchikov·· 9 小时前AI 评分34

Common Corpus:面向 LLM 预训练的最大规模伦理数据集

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

AI 导读

Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。

来源:arXiv cs.CL · arxiv.org