内容提要
本文介绍9个数学推理数据集,涵盖竞赛级问题、多语言多模态、工具增强推理及知识依赖建模等方向,旨在提升大模型推理能力。包括Math-Graph定理依赖图、Nemotron-SFT-Math-v4、MathNet多模态基准、Nemotron-Math-v2、CHIMERA合成数据、Open-RL、GPT-5.4逐步推理、Sutra 10B预训练及VisCoR-55K视觉推理,助力模型训练与评测。
延伸解读
数据集的多样性趋势
这9个数据集反映了数学推理数据从单一问答向多维度演进的趋势:既有竞赛级问题(MathNet),也有合成数据(CHIMERA、GPT-5.4),还有工具增强推理(Nemotron系列)和知识依赖图(Math-Graph)。这种多样性意味着研究者可以根据不同训练目标选择合适的数据,例如需要强化学习可验证问题时可参考Open-RL,而多模态场景则可用VisCoR-55K。
合成数据与验证机制
多个数据集(如CHIMERA、GPT-5.4)采用LLM生成合成数据,并通过自动验证确保质量,减少人工标注成本。但合成数据可能引入模型偏差,因此Nemotron-Math-v2采用LLM作为裁判进行验证,Open-RL强调可验证的最终答案。这提示使用合成数据时需关注验证流程的严谨性,避免模型在生成数据上过拟合。
多模态与多语言覆盖
MathNet和VisCoR-55K等数据集强调多模态(图像、图表)和多语言(17种语言)能力,这反映了数学推理不仅限于文本,还需处理几何图形和跨语言问题。对于希望提升模型在真实世界数学应用(如教育、科研)中表现的开发者,这类数据集更具针对性,但需注意其规模(如MathNet v0仅2.7万题)可能限制泛化。
Q&A
Math-Graph 数据集的主要内容和用途是什么?
Math-Graph 是由华盛顿大学数学人工智能实验室发布的数学定理依赖图数据集,包含 47,952 条非形式化与形式化数学语句匹配对,构建了语句级粒度的数学定理依赖图,覆盖论文元数据、数学语句、依赖关系边及 LLM 生成的自然语言描述。它用于整合形式化与非形式化数学知识,支持数学推理和知识结构建模。
Nemotron-SFT-Math-v4 数据集包含哪些类型的推理样本?
Nemotron-SFT-Math-v4 包含 545,431 条训练样本,其中 285,516 条为 CoT(思维链)推理样本,259,915 条为 TIR(工具推理)样本,覆盖代数、几何、数论、组合数学等竞赛和科研级数学场景。
MathNet 数据集支持哪些基准任务?
MathNet 支持三个基准任务:数学问题求解、数学语义检索(识别结构等价及相似试题)、检索增强问题求解。
Nemotron-Math-v2 数据集是如何生成推理轨迹的?
Nemotron-Math-v2 包含约 34.7 万个数学问题和 700 万个模型生成的推理轨迹。每个问题在六种配置下求解,包括高/中/低推理深度以及是否使用 Python TIR,答案通过 LLM 作为裁判的管道进行验证。
CHIMERA 数据集有什么特点?
CHIMERA 是一个合成推理数据集,涵盖 8 个 STEM 学科,包含 9,225 个问题,所有示例由 LLM 生成并通过自动验证,无需人工标注,提供长链思维(CoT)轨迹。
Open-RL 数据集适合用于哪些训练或评测?
Open-RL 数据集适合用于强化学习微调、奖励建模、结果监督训练以及可验证推理基准测试。
GPT-5.4 逐步推理数据集的任务难度和领域是什么?
GPT-5.4 逐步推理数据集包含约 1,500 条精英级样本,覆盖数学、编程与医学等高复杂度领域,任务难度设定为“Grandmaster”和“Beyond-PhD”级别。
Sutra 10B Pretraining 数据集包含多少数据?
Sutra 10B Pretraining 包含 10,193,029 条教学记录,总规模超过 100 亿个 token,涵盖九大领域,难度分为 10 个等级。
VisCoR-55K 数据集的主要特点是什么?
VisCoR-55K 是由华中科技大学联合阿里云发布的视觉推理数据集,包含约 55,000 个样本,每个样本利用对比样本生成推理过程,涵盖通用、推理、数学、图表及 OCR 五大类别,旨在促进视觉语言模型的可信稳健推理。