内容提要
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。
延伸解读
Muon 与 AdamW 的分工逻辑
V4 并非全盘改用 Muon,而是按参数类型分工:所有矩阵权重(如注意力投影、MoE 专家矩阵)用 Muon,而 embedding、LM head、RMSNorm 增益、mHC 的偏置和门等非矩阵参数仍用 AdamW。这种分工源于 Muon 的逐矩阵正交化只对线性算子有意义,而向量和标量无法直接套用。论文还指出,正交化是对每个“逻辑上独立的权重”单独进行的,例如分组输出投影的 16 个组、每个 expert 的三个矩阵都各自独立处理,这有助于理解优化器的作用粒度。
Newton–Schulz 混合迭代的工程取舍
为避免每步 SVD 的高昂成本,V4 采用 Newton–Schulz 迭代逼近正交化,并用两组系数分阶段处理奇异值:前 8 步用 Jordan 系数(3.4445, -4.7750, 2.0315),其原点斜率大,能快速抬升小奇异值,但 1 不是不动点,奇异值会在 0.7~1.2 间震荡;后 2 步换用 (2, -1.5, 0.5),使 1 成为不动点且导数 0,实现二次收敛,精确稳定大奇异值。这种混合设计在快速收敛与精确稳定之间取得平衡,但论文未解释为何 V4 需要精确正交化而 Jordan 不需要,推测与大规
Q/KV 归一化为何取代 QK-Clip
Muon 优化器已知会使注意力 logit 爆炸,Kimi K2 曾用 MuonClip 事后缩放权重来应对。V4 则从结构上解决:query 展开成 128 头后逐头 RMSNorm,KV 向量也做 RMSNorm,在计算 logit 前固定了 q 和 k 的尺度,使 logit 上界与权重范数无关。因此无需 QK-Clip。这一方案依赖 V4 的单头 KV 设计——MLA 的 latent 展开后才有多头,对 latent 归一化无法控制展开后的尺度,而 K=V 的单头结构恰好规避了此问题。
Anticipatory Routing 的触发机制与代价
针对 MoE 路由正反馈导致的 loss spike,V4 引入 Anticipatory Routing:将路由索引的计算与特征计算在时间上解耦,路由索引使用 Δt 步前的参数,特征用当前参数。实现上通过提前预取数据多跑一次前向来缓存索引,额外时间约 20%,但仅在检测到 spike 后临时开启,自动回滚并运行一阵后关闭,因此整体开销可忽略。论文称该机制不损性能,与 SwiGLU 截断共同构成训练稳定性的两大支柱。
Q&A
DeepSeek-V4 为什么使用 Muon 优化器而不是 AdamW?
DeepSeek-V4 使用 Muon 优化器是因为 Transformer 中的参数大多是矩阵,而 AdamW 逐元素更新无法有效处理梯度矩阵奇异值分布不均的问题,导致长尾方向学习缓慢。Muon 通过谱范数最速下降实现逐矩阵正交化,使所有奇异方向得到同等更新,从而提升训练效率。
Muon 优化器中的 Newton-Schulz 迭代是如何工作的?
Newton-Schulz 迭代通过矩阵乘法逼近正交化过程,避免昂贵的 SVD。它先将矩阵除以 Frobenius 范数,然后反复应用多项式 p(σ)=aσ+bσ^3+cσ^5 来调整奇异值,使其趋近于 1。DeepSeek-V4 采用混合迭代:前 8 步使用系数 (3.4445, -4.7750, 2.0315) 快速提升小奇异值,后 2 步使用系数 (2, -1.5, 0.5) 精确稳定大奇异值。
DeepSeek-V4 中哪些参数不使用 Muon 优化器?
DeepSeek-V4 中,embedding 和 LM head、RMSNorm 的增益向量、mHC 的静态偏置和门等非矩阵参数不使用 Muon,而是继续使用 AdamW。其余矩阵参数(如注意力投影、MoE 专家矩阵等)使用 Muon。
DeepSeek-V4 为什么不需要 QK-Clip 来防止注意力 logit 爆炸?
DeepSeek-V4 不需要 QK-Clip,因为其注意力架构在计算 logit 之前对 query 和 KV 进行了 RMSNorm,固定了它们的尺度,从而限制了 logit 的上界,与权重矩阵的范数无关。这使得 Muon 下权重谱范数增长不会导致 logit 爆炸。
Anticipatory Routing 是如何帮助稳定 DeepSeek-V4 训练的?
Anticipatory Routing 通过将路由决策与特征计算在时间上解耦:路由索引使用 Δt 步之前的参数计算,而特征使用当前参数。这打断了 MoE 路由的正反馈循环,防止 loss spike 放大。该模式仅在检测到 loss spike 后临时启用,开销可忽略。
DeepSeek-V4 的 MTP(多 token 预测)模块在训练中起什么作用?
MTP 模块用于预测下一个 token(即第 t+2 个 token),损失权重为 0.3,学习率衰减时降至 0.1。它包含一个完整的 decoder block,具有自己的注意力、MoE 和 mHC 参数,输入为主干输出和下一 token embedding,输出与主干共享最终 RMSNorm 和 LM head。
DeepSeek-V4 的训练配方中主要超参数有哪些?
DeepSeek-V4 训练使用 32T token,最大 batch 为 75.5M token,峰值学习率 2.7×10^-4 衰减至 2.7×10^-5,warmup 2000 步,序列长度从 4K 逐步增至 1M。Muon 的 RMS 匹配系数 γ 为 0.18,动量 0.95,权重衰减 0.1。