AutoPureData: 网络数据的自动过滤用于 LLM 微调
内容提要
本文探讨了利用经过过滤的网络数据训练大型语言模型的有效性,强调数据筛选的重要性。研究创建了包含1030万个网站创作者自我描述的数据集,并分析了不同质量和语言过滤器的影响。通过自动数据加工和知识蒸馏技术,模型在网页分类任务中的准确度显著提高。此外,提出了从网页数据中提取高质量中文文本的方法,并发布了大规模中文数据集,以支持语言模型研究。
延伸解读
数据筛选的社会维度影响
研究基于1030万个网站创作者的自我描述,分析了十种质量过滤器和语言标识过滤器对网页社交维度的影响。发现质量分类器可能像专题领域过滤器一样,隐含地偏好某些领域;而语言标识过滤器可能忽视世界上某些地区的英语内容。这提示数据筛选不仅关乎质量,还可能引入社会偏差,影响模型对不同群体和地区的代表性。
高效过滤与模型性能的平衡
通过困惑度方法筛选高质量数据,仅使用原始训练数据的30%就能改进基准模型,表明大部分预训练数据可被删除而保持性能。同时,基于知识蒸馏的URL分类模型准确度提升9%,且手工标记数据量减少三个数量级。这些方法为大规模数据筛选提供了高效途径,但需注意过滤可能损失部分正确信息。
中文网络文本资源的发布
研究发布了ChineseWebText,包含1.42 TB的高质量中文网络文本,并为每个文本分配质量评分,方便研究者按需选择。此外,还提供了600 GB质量超过90%的清洁子集。这一资源有助于推动中文大语言模型的研究,但使用者需根据具体任务评估数据质量与多样性。
有害文本过滤的权衡
提出一种从网页规模数据集中识别和过滤有害文本的方法,使用预训练语言模型计算触发词组的对数似然。过滤后的数据集训练的语言模型产生有害文本的倾向更低,但性能与未过滤基线相比略有降低。这表明安全性与模型能力之间存在权衡,实际应用中需根据场景调整过滤强度。
Q&A
如何利用过滤的网络数据训练大型语言模型?
可以通过使用经过过滤和去重的网络数据来训练大型语言模型,达到良好的性能,且不需要过多依赖高质量的非网络数据。
研究中创建了什么样的数据集?
研究创建了一个包含1030万个网站创作者自我描述的数据集,提取了他们的兴趣、社交角色和地理隶属的信息。
知识蒸馏技术如何提高模型的准确度?
通过知识蒸馏技术,模型在以URL为基础的网页分类任务中的准确度提高了9%。
如何从网页数据中提取高质量中文文本?
提出了EvalWeb工具链,用于从嘈杂的网络数据中提取干净的中文文本,支持大型语言模型的研究。
困惑度方法在数据质量评估中有什么优势?
困惑度方法在去除数据噪声和提升预训练数据集质量方面效果较好,能够在仅使用原始训练数据的30%进行训练的情况下改进基准模型。
过滤有害文本的方法是什么?
提出了一种通过计算特定文档条件下的触发词组的对数似然来识别和过滤有害文本的方法,证明过滤后的数据集上训练的模型产生有害文本的倾向更低。