该论文提出“结构信息”新概念,挑战传统信息论,认为AI训练中大量数据是随机噪声,真正有用的是可拆解重组的结构信息。研究发现,数据顺序影响模型学习能力,简单规则可涌现复杂行为,文本数据的结构信息含量高于图像。这为数据选择提供理论依据,强调追求可学习的新颖性,而非盲目追求低损失。
本文提出了一种基于Mimic Score的新数据选择方法,旨在优化大规模网络数据集中的样本选择,以提高数据效率。该方法通过参考模型权重评估样本质量,并在六个图像数据集上实现了性能提升。
OpenAI的研究揭示了大语言模型产生幻觉的原因,包括评估体系和训练数据的问题。GPT-5通过鼓励模型承认“不知道”来减少幻觉,这类似于教育孩子的方式。有效的数据选择和逻辑训练对AI和儿童教育都至关重要。
本文提出了一种基准目标排名方法(BETR),通过比较预训练文档与基准训练示例的相似性来优化数据选择。BETR在共享空间中嵌入基准示例和预训练文档,利用相似性评分训练轻量级分类器。研究表明,BETR在多个任务上显著提升性能,且更大的模型需要更少的过滤,强调数据选择策略需适应模型规模。
本研究提出了一种高效的迭代数据选择框架LEAD,旨在降低计算开销。LEAD通过准确估计样本效用,消除额外的模型推理需求,从而显著提升模型性能并缩短训练时间。
本研究提出了一种新方法ICon,克服了现有数据选择在指令调优中的局限性。实验结果表明,ICon选择的15%数据训练模型的性能超过使用全数据集,显示出其高效性和有效性。
本研究提出了一种数据选择策略,以提高大型语言模型在代码生成任务中的训练效率和效果。通过优化数据复杂性和Token化过程,显著提升了模型性能并减少了计算资源消耗。
本研究提出MASS框架,旨在解决大型语言模型预训练中的数据选择问题。该框架通过数学推理技能图有效捕捉数学技能及其关系,实验结果显示显著提升了模型的训练效率和效果。
本文探讨了在指令微调阶段选择预训练大型语言模型(LLMs)数据的方法,提出了一种新的多模态评分机制,以提升数据质量和多样性。研究表明,该方法在多个实验中比随机采样和现有方法更有效,显著提高了模型性能。
本研究提出了一种新原则,以优化大型语言模型的数据选择,减少噪声数据的影响。实验表明,仅使用10%的数据集,性能提升3%至8%,同时降低计算成本,展示了数据选择的潜力。
本研究提出QLess方法,旨在解决大语言模型微调中因计算成本限制导致的数据选择效率问题。QLess结合梯度量化与LESS框架,通过两步压缩实现高效数据选择,实验结果表明其在数据估值质量上表现优异,且具备良好的可扩展性。
本研究探讨了传统数据影响估计方法在现代训练中的有效性,特别是数据顺序的敏感性。提出了一种新的逐个剔除影响的方法,并引入数据价值嵌入技术。研究表明,训练初期和后期的数据点对模型有显著影响,为数据选择提供了新策略。
本研究提出了协作框架DataTailor,旨在解决视觉指令数据集扩展中的数据冗余和高计算成本问题。该框架通过信息量、独特性和代表性进行数据选择,实验表明仅使用15%的数据即可实现全数据微调性能的100.8%,有效降低计算成本。
本研究提出了一种重叠密度的数据中心机制,解决了对弱到强泛化现象的理解不足,显著提升了弱模型的性能,并为数据选择提供了指导。
本文提供了12个SQL示例,涵盖基本数据选择、记录过滤、结果排序、限制结果、聚合函数、连接、子查询、计算列、去重、更新与删除数据、表的创建与操作,以及高级查询。每个示例均附有详细解释,以帮助理解SQL的基本用法和最佳实践。
本研究分析了多语言信息提取的局限性,并提出了零样本跨语言迁移学习的方法。通过探讨语言间的距离及其度量,优化数据选择,为构建更广泛的多语言信息提取系统奠定基础。
本研究提出了一种梯度轨迹追踪(GTP)方法,显著提升了数据选择的效率和效果。实验结果表明,仅使用0.5%的数据量,仍能保证目标任务的性能,表现优异。
本文探讨了动态知识蒸馏的方法,分析了教师模型选择、数据选择和蒸馏目标调整的影响。实验结果表明,动态知识蒸馏具有良好前景,并提出了更有效的知识蒸馏方法,如GKD、MiniLLM和DistiLLM等,这些方法在复杂任务中表现优于传统方法,为未来研究指明了方向。
本文提出了一种名为可微分数据选择(DDS)的强化学习方法,通过优化数据选择来提升机器翻译和图像分类等任务的性能。研究引入了“预学习数据大小”概念,提出了基于PMP的数据选择框架(PDS),并强调在微调模型时选择高质量数据的重要性。实验结果表明,该方法在资源有限的情况下显著提高了模型性能。
在机器学习中,数据选择比模型更重要。数据优化依赖于领域专家的理解,是AI项目成功的关键。数据策划需要领域和机器学习的专业知识,无法自动化或外包,并需深入讨论数据偏见。
完成下面两步后,将自动完成登录并继续当前操作。