Re0: 当表达细节成为 FP4 新瓶颈时,我们是否仍要坚守 E2M1?
内容提要
本文探讨了FP4低精度训练中E2M1格式的局限性,提出E1M2格式可能是更优选择。研究发现E2M1存在收缩偏差,影响训练收敛速度。通过引入随机Hadamard变换(RHT),在E1M2格式下可提高量化质量,推动FP4训练向“局部分辨率主导”转变,建议未来硬件重新评估格式选择。
关键要点
-
FP4低精度训练中E2M1格式存在收缩偏差,影响训练收敛速度。
-
E1M2格式在量化质量上表现优于E2M1,可能是更优选择。
-
引入随机Hadamard变换(RHT)后,E1M2格式的量化质量得到提升。
-
低精度训练的发展速度慢于推理,主要因为训练需要更长时间验证新格式的可靠性。
-
历史经验导致E2M1成为主流选择,但并不一定是最佳选择。
-
随着量化粒度的细化,动态范围的控制逐渐转移到量化格式的选择上。
-
UFP4方案在E1M2格式下,通过RHT提升了量化质量,减少了对E2M1的依赖。
-
未来硬件应重新评估格式选择,不应仅依赖E2M1。
延伸解读
E2M1格式的局限性
E2M1格式在FP4低精度训练中存在收缩偏差,这种偏差会影响训练的收敛速度。虽然E2M1曾是主流选择,但其局限性逐渐显露,尤其是在处理大模型时,可能导致训练效率低下。
E1M2的潜力
研究表明,E1M2格式在量化质量上优于E2M1,尤其是在引入随机Hadamard变换(RHT)后,E1M2的表现更为突出。这提示我们在未来的硬件设计中,可能需要重新评估格式选择,考虑E1M2的应用潜力。
低精度训练的挑战
低精度训练的发展速度慢于推理,主要是因为训练需要长时间验证新格式的可靠性。新格式的引入不仅要考虑加速收益,还需评估潜在风险,这使得训练侧的探索成本显著高于推理侧。
延伸问答
E2M1格式在FP4低精度训练中存在哪些问题?
E2M1格式存在收缩偏差,导致量化过程中有偏差,影响训练收敛速度。
为什么E1M2格式可能是FP4训练的更优选择?
E1M2格式在量化质量上表现优于E2M1,且通过引入随机Hadamard变换可提升量化效果。
随机Hadamard变换(RHT)如何影响FP4训练?
RHT通过提高bucket利用率,降低量化下溢比例,但在E2M1下可能加剧收缩偏差,影响训练效果。
低精度训练发展缓慢的原因是什么?
低精度训练需要长时间验证新格式的可靠性,探索成本高于推理侧,导致发展速度慢。
未来硬件在格式选择上应考虑哪些因素?
未来硬件应重新评估格式选择,不应仅依赖E2M1,考虑细粒度量化和局部分辨率主导的新范式。
E2M1格式的主流地位是如何形成的?
E2M1成为主流是由于历史经验的延续,承载了FP16、BF16、FP8的选择惯性。