数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源9个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

本文介绍9个数学推理数据集,涵盖竞赛级问题、多语言多模态、工具增强推理及知识依赖建模等方向,旨在提升大模型推理能力。包括Math-Graph定理依赖图、Nemotron-SFT-Math-v4、MathNet多模态基准、Nemotron-Math-v2、CHIMERA合成数据、Open-RL、GPT-5.4逐步推理、Sutra 10B预训练及VisCoR-55K视觉推理,助力模型训练与评测。

🔎

延伸解读

数据集的多样性趋势

这9个数据集反映了数学推理数据从单一问答向多维度演进的趋势:既有竞赛级问题(MathNet),也有合成数据(CHIMERA、GPT-5.4),还有工具增强推理(Nemotron系列)和知识依赖图(Math-Graph)。这种多样性意味着研究者可以根据不同训练目标选择合适的数据,例如需要强化学习可验证问题时可参考Open-RL,而多模态场景则可用VisCoR-55K。

合成数据与验证机制

多个数据集(如CHIMERA、GPT-5.4)采用LLM生成合成数据,并通过自动验证确保质量,减少人工标注成本。但合成数据可能引入模型偏差,因此Nemotron-Math-v2采用LLM作为裁判进行验证,Open-RL强调可验证的最终答案。这提示使用合成数据时需关注验证流程的严谨性,避免模型在生成数据上过拟合。

多模态与多语言覆盖

MathNet和VisCoR-55K等数据集强调多模态(图像、图表)和多语言(17种语言)能力,这反映了数学推理不仅限于文本,还需处理几何图形和跨语言问题。对于希望提升模型在真实世界数学应用(如教育、科研)中表现的开发者,这类数据集更具针对性,但需注意其规模(如MathNet v0仅2.7万题)可能限制泛化。

Q&A

Math-Graph 数据集的主要内容和用途是什么?

Math-Graph 是由华盛顿大学数学人工智能实验室发布的数学定理依赖图数据集,包含 47,952 条非形式化与形式化数学语句匹配对,构建了语句级粒度的数学定理依赖图,覆盖论文元数据、数学语句、依赖关系边及 LLM 生成的自然语言描述。它用于整合形式化与非形式化数学知识,支持数学推理和知识结构建模。

Nemotron-SFT-Math-v4 数据集包含哪些类型的推理样本?

Nemotron-SFT-Math-v4 包含 545,431 条训练样本,其中 285,516 条为 CoT(思维链)推理样本,259,915 条为 TIR(工具推理)样本,覆盖代数、几何、数论、组合数学等竞赛和科研级数学场景。

MathNet 数据集支持哪些基准任务?

MathNet 支持三个基准任务:数学问题求解、数学语义检索(识别结构等价及相似试题)、检索增强问题求解。

Nemotron-Math-v2 数据集是如何生成推理轨迹的?

Nemotron-Math-v2 包含约 34.7 万个数学问题和 700 万个模型生成的推理轨迹。每个问题在六种配置下求解,包括高/中/低推理深度以及是否使用 Python TIR,答案通过 LLM 作为裁判的管道进行验证。

CHIMERA 数据集有什么特点?

CHIMERA 是一个合成推理数据集,涵盖 8 个 STEM 学科,包含 9,225 个问题,所有示例由 LLM 生成并通过自动验证,无需人工标注,提供长链思维(CoT)轨迹。

Open-RL 数据集适合用于哪些训练或评测?

Open-RL 数据集适合用于强化学习微调、奖励建模、结果监督训练以及可验证推理基准测试。

GPT-5.4 逐步推理数据集的任务难度和领域是什么?

GPT-5.4 逐步推理数据集包含约 1,500 条精英级样本,覆盖数学、编程与医学等高复杂度领域,任务难度设定为“Grandmaster”和“Beyond-PhD”级别。

Sutra 10B Pretraining 数据集包含多少数据?

Sutra 10B Pretraining 包含 10,193,029 条教学记录,总规模超过 100 亿个 token,涵盖九大领域,难度分为 10 个等级。

VisCoR-55K 数据集的主要特点是什么?

VisCoR-55K 是由华中科技大学联合阿里云发布的视觉推理数据集,包含约 55,000 个样本,每个样本利用对比样本生成推理过程,涵盖通用、推理、数学、图表及 OCR 五大类别,旨在促进视觉语言模型的可信稳健推理。

🏷️

标签

➡️

继续阅读