跳到正文
arXiv cs.CL· Melik\c{s}ah T\"urker, A. Ebrar K{\i}z{\i}lo\u{g}lu, Onur G\"ung\"or, Susan \"Usk\"udarl{\i}·· 9 小时前AI 评分25

TabiBERT:基于 ModernBERT 的土耳其语大规模基础模型与统一基准 TabiBench

TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish

AI 导读

研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。

来源:arXiv cs.CL · arxiv.org