【Transformer 与注意力机制】36|训练稳定性:损失尖峰、混合精度与梯度爆炸
原文中文,约15500字,阅读约需37分钟。
📝
内容提要
大模型训练最怕的不是 loss 降得慢,而是它在一切正常时突然尖峰、发散、NaN。本文从 GLM-130B、OPT-175B、PaLM 的真实训练事故出发,讲清 loss spike、梯度爆炸的现场停训判据,warmup、Pre-LN、BF16、梯度裁剪各自修复的是哪个假设,以及为什么小模型上验证过的稳定超参放大后会失效。
🏷️