内容提要
该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和均为1),经Sinkhorn-Knopp迭代投影实现,使复合映射增益从3000降至1.6。初始化时等价于普通Transformer,参数量仅占0.005%,带来推理性能提升,并与Kimi K3的Attention Residuals形成对比。
延伸解读
双随机矩阵:稳定性的关键约束
mHC将残差流拓宽为4条后,无约束的混合矩阵会导致复合映射增益高达3000,训练不稳定。通过将混合矩阵约束为双随机矩阵(非负、行和列和均为1),增益降至1.6。这一约束保证了谱范数不超过1,且乘法封闭,使深层复合映射保持稳定,是mHC能稳定训练的核心。
初始化即普通Transformer
mHC在初始化时通过设置α≈0、静态偏置S=0,使得读算子A为[0.5,0.5,0.5,0.5],写算子C为[1,1,1,1],混合矩阵B为均匀矩阵,此时4条流内容相同,前向传播与普通pre-norm Transformer逐层等价。这意味着mHC在训练初期不改变模型行为,而是通过后续学习逐渐利用多流优势。
与Kimi K3的Attention Residuals对比
mHC和Kimi K3的Attention Residuals都旨在改进残差连接,但机制不同:mHC将残差流拓宽为4条,通过线性变换混合,类似线性注意力;而Attention Residuals使用softmax加权历史层输出,类似softmax注意力。mHC状态固定,访存成本较高(约34d),但V4通过kernel融合和重算优化,将墙钟开销压至6.7%。
Q&A
DeepSeek-V4 的 mHC 残差结构相比普通 Transformer 的残差连接有什么不同?
普通 Transformer 只有一条残差流,而 mHC 将残差流拓宽为 4 条,每条 d 维。每个子层通过读、写、混三个算子与这 4 条流交互:读算子将 4 条流加权求和作为子层输入,写算子将子层输出分配到各条流,混算子让流之间互相混合。
为什么无约束的 Hyper-Connections 会导致训练不稳定?
无约束的混合矩阵 B 在多层复合后,其连乘可能随深度指数放大或缩小,导致前向信号和反向梯度的增益失控。在 27B 模型上,无约束 HC 的复合映射增益最高可达 3000,同时 loss 在 12k 步附近突然上跳、梯度范数不稳。
mHC 如何约束混合矩阵 B 以保证稳定性?
mHC 将混合矩阵 B 约束为双随机矩阵,即满足非负、行和与列和均为 1。这保证了谱范数不超过 1,且乘法封闭,使得任意多层复合后仍保持非扩张性,从而稳定训练。
Sinkhorn-Knopp 迭代在 mHC 中起什么作用?
Sinkhorn-Knopp 迭代用于将任意矩阵投影到双随机矩阵集合上。它通过交替归一化行和列,使矩阵满足行和列和均为 1。在 mHC 中,对 exp(B̃) 进行 20 轮迭代,得到双随机矩阵 B。
DeepSeek-V4 的 mHC 在初始化时如何等价于普通 Transformer?
当 α 初始化为很小值、静态偏置 S 为 0 时,读权重 A 为 [0.5,0.5,0.5,0.5],写权重 C 为 [1,1,1,1],混合矩阵 B 为均匀矩阵(每个元素 1/4)。由于 4 条流初始内容相同,整个网络的前向与普通 pre-norm Transformer 逐层相等。
mHC 相比普通残差连接带来了哪些性能提升?
在 27B 模型上,mHC 相比基线最终 loss 降低 0.021,下游任务如 BBH 从 43.8 提升到 51.0,DROP 从 47.0 提升到 53.9,GSM8K 从 46.7 提升到 53.8,MMLU 从 59.0 提升到 63.4,且优势在 3B、9B、27B 规模上基本不衰减。
mHC 与 Kimi K3 的 Attention Residuals 有何区别?
两者都改变层间信息组合方式,但形态不同。mHC 使用固定 4 条流,混合矩阵为双随机矩阵,类似线性注意力;Attention Residuals 使用 softmax 加权,类似 softmax 注意力。mHC 的访存成本更高,但 Attention Residuals 的访存成本相对较低。