通义千问开源Qwen2-Math,成为最先进的数学专项模型

通义千问开源Qwen2-Math,成为最先进的数学专项模型

💡 原文中文,约1300字,阅读约需3分钟。
📝

内容提要

阿里通义团队开源了新一代数学模型Qwen2-Math,包含1.5B、7B、72B三个参数的基础模型和指令微调模型。Qwen2-Math-72B-Instruct在MATH基准测评中的准确率达到84%,超过其他开源数学模型。Qwen2-Math基础模型使用Qwen2大语言模型进行初始化,并在数学专用语料库上进行预训练。研发团队训练了指令微调版本模型,通过奖励模型和二元信号进行学习。Qwen2-Math目前主要支持英文,但将推出中英双语版本和多语言版本。阿里通义团队希望通过开源模型为科学界解决高级数学问题做出贡献。

🔎

延伸解读

数学模型为何成为大模型能力的试金石

文章指出,处理高级数学问题需要模型具备复杂多步逻辑推理能力,因此数学能力被视为大模型推理水平的重要标尺。Qwen2-Math在MATH基准上达到84%准确率,并超越多个知名开闭源模型,说明专项优化在数学领域能带来显著提升。这也解释了为何业界将数学解题视为大模型研究的关键课题。

从基础模型到指令微调:Qwen2-Math的训练路径

Qwen2-Math基础模型以Qwen2大语言模型为起点,在数学专用语料库上预训练,数据涵盖网络文本、书籍、代码、考试题目及Qwen2合成的数学数据,并做了去污染处理。指令微调阶段则先训练数学专用奖励模型,再结合密集奖励信号与二元正确性信号,通过拒绝采样构建SFT数据,最后用GRPO优化。这一流程体现了对数学推理任务的针对性设计。

评测覆盖广:从常见基准到竞赛级难题

除GSM8K和MATH外,团队还引入OlympiadBench、CollegeMath、AIME 2024、AMC 2023以及中文的CMATH、中国高考和中考题等十大测评。Qwen2-Math-72B-Instruct在这些测评中均取得远超其他开源数学模型的成绩。多维度、高难度的评测体系,有助于更全面地反映模型在代数、几何、数论等领域的实际解题能力。

当前以英文为主,多语言版本值得期待

文章明确提到,Qwen2-Math系列目前主要支持英文,中英双语版本即将推出,多语言版本也在开发中。这意味着现阶段非英文用户直接使用可能受限,但团队已规划扩展语言覆盖。对于关注中文数学场景的读者,后续双语版本的实际表现和评测结果值得持续留意。

❓

Q&A

Qwen2-Math模型有哪些参数版本?

Qwen2-Math模型包含1.5B、7B和72B三个参数版本。

Qwen2-Math-72B-Instruct在MATH基准测评中的表现如何?

Qwen2-Math-72B-Instruct在MATH基准测评中的准确率达到84%,超过其他开源数学模型。

Qwen2-Math模型是如何进行预训练的?

Qwen2-Math基础模型使用Qwen2大语言模型进行初始化,并在数学专用语料库上进行预训练。

Qwen2-Math模型的指令微调版本是如何训练的?

指令微调版本模型结合奖励模型和二元信号进行学习,使用拒绝采样构建监督微调数据。

Qwen2-Math模型支持哪些语言?

Qwen2-Math目前主要支持英文,未来将推出中英双语版本和多语言版本。

通义团队希望通过Qwen2-Math模型实现什么目标?

通义团队希望通过开源模型为科学界解决高级数学问题做出贡献。

🏷️

标签

➡️

继续阅读