该研究探讨了在数据受限条件下,语言模型预训练中混合稀缺目标数据与通用数据的权衡。通过2000多次实验,发现重复使用目标数据15-20次可提升性能,并提出了考虑重复价值递减的缩放定律,以优化混合配置。
CLUE发布了100G中文语料库CLUECorpus2020,可用于自监督学习和语言模型预训练。作者还发布了新的中文词汇表和经过预训练的模型,并将其代码和数据集发布在Github上。实验结果表明,训练在此语料库上的模型在中文上表现出色。
完成下面两步后,将自动完成登录并继续当前操作。