arXiv cs.CL· Clara Meister, G\"ul Sena Alt{\i}nta\c{s}, Antoine Bosselut·· 3 小时前AI 评分22
多语言语言模型中分词器选择的语言特异性影响
Language-Specific Effects of Tokenizer Choice in Multilingual Language Models
AI 导读
研究训练了覆盖 54 种分词器的 123 个语言模型,发现分词器选择对语言模型训练数据较少的语言影响更大:一个语言的 bits-per-byte(BPB)标准差随其训练数据占比下降而上升(Spearman rho = -0.52,31 种训练语言)。将某语言排除在分词器训练之外会提高其 BPB,且对低资源语言惩罚更大;但给低资源语言更大分词器训练数据份额并非无条件有益。
来源:arXiv cs.CL · arxiv.org