聊一聊我们最近开源的 Ling 2.0 原生 FP8 混合精度训练

💡 原文中文,约5800字,阅读约需14分钟。
📝

内容提要

Ling 2.0 采用 FP8 混合精度训练,显著提升了训练效率和显存利用率。细粒度量化减少了量化误差,确保模型效果接近 BF16。与 LLaMA 3.1 和 Qwen3 比较,Ling-mini-2.0 在多 GPU 环境下吞吐量提升达 30-120%。该方案为低精度训练提供了有效路径,解决了计算资源和能耗挑战。

🎯

关键要点

  • Ling 2.0 采用 FP8 混合精度训练,显著提升训练效率和显存利用率。

  • 细粒度量化减少了量化误差,确保模型效果接近 BF16。

  • 在多 GPU 环境下,Ling-mini-2.0 的吞吐量提升达 30-120%。

  • 低精度训练有效解决计算资源和能耗挑战。

  • FP8 训练方案是业界首个在 MoE 模型上支持 FP8 混合精度训练的完整开源方案。

  • FP8 量化方法通过细粒度的 tile/block wise scaling 避免了离群点对全局量化误差的影响。

  • FP8 优化器显著降低了显存占用,使得在有限硬件下支持更大模型的训练。

  • 在训练性能测试中,Ling-mini-2.0 在开启 MTP 时可获得 30-60% 吞吐提升,关闭 MTP 时则达到 90-120% 吞吐提升。

🔎

延伸解读

FP8混合精度训练的优势

Ling 2.0采用FP8混合精度训练,显著降低了显存占用,使得在有限硬件条件下能够训练更大规模的模型。这种低精度训练不仅提高了计算效率,还有效解决了计算资源和能耗的挑战,适合大规模模型的研发和应用。

细粒度量化的重要性

Ling 2.0通过细粒度量化技术,减少了量化误差,确保模型效果接近BF16。这种方法通过对矩阵进行分块处理,避免了离群点对全局量化精度的影响,从而提升了训练的稳定性和收敛速度,适合超大规模模型的训练需求。

训练性能的提升

在多GPU环境下,Ling-mini-2.0的吞吐量提升显著,开启MTP时可达30-60%,关闭MTP时甚至可达90-120%。这种性能提升使得在相同时间内可以完成更多的训练任务,极大提高了训练效率,适合需要快速迭代的研发场景。

延伸问答

Ling 2.0 的 FP8 混合精度训练有什么优势?

Ling 2.0 的 FP8 混合精度训练显著提升了训练效率和显存利用率,减少了量化误差,确保模型效果接近 BF16。

Ling-mini-2.0 在多 GPU 环境下的性能表现如何?

在多 GPU 环境下,Ling-mini-2.0 的吞吐量提升达 30-120%,具体取决于 MTP 的开启与否。

FP8 训练方案如何解决计算资源和能耗挑战?

FP8 训练方案通过降低显存占用和提高计算效率,有效解决了计算资源和能耗的挑战。

细粒度量化在 FP8 训练中起到什么作用?

细粒度量化通过减少量化误差,避免离群点对全局量化精度的影响,从而保障模型训练的效果。

Ling 2.0 的开源地址在哪里?

Ling 2.0 的开源地址是 https://github.com/inclusionAI/Ling-V2。

FP8 训练方案的量化过程是怎样的?

FP8 训练方案的量化过程是将原始 BF16 tensor 转为 FP8 tensor 和 scale tensor,确保训练过程中的数值表达。

🏷️

标签

➡️

继续阅读