斯堪的纳维亚语言的大型网络数据集SWEb

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本研究通过SWEb数据集解决了斯堪的纳维亚语言预训练数据不足的问题。使用新型文本提取器简化处理,并推出新的填空式基准评估方法,结果与FineWeb数据集上的模型表现相当。

🏷️

标签

➡️

继续阅读