DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4

DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4

💡 原文中文,约12100字,阅读约需29分钟。
📝

内容提要

本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与MoE结构。相比V3.2,推理FLOPs降至27%、KV缓存仅10%。文章提供层排布、维度对照表及参数明细,并预告后续将分篇详解各模块设计。

🔎

延伸解读

阅读前需注意的细节

本文是连载开篇,主要提供总览和阅读地图,不深入技术细节。文中层号按0-indexed,与config.json一致;Pro和Flash结构相同但尺寸不同,Flash前两层为纯滑窗注意力。若需理解具体实现,建议结合论文§2及后续分篇阅读。

效率提升的关键设计

V4相比V3.2,在1M上下文下推理FLOPs降至27%、KV缓存仅10%,主要得益于CSA/HCA压缩注意力与mHC多残差流设计。但需注意,这些数字是论文给出的理论值,实际部署效果可能受硬件、实现等因素影响。

参数规模与激活参数的区别

Pro总参数1.6T但每token仅激活49B,Flash总参数284B激活13B,说明模型采用MoE架构,推理时只激活部分专家。总参数与激活参数的差距反映了稀疏激活的特性,对部署时的显存和算力需求有重要影响。

Q&A

DeepSeek-V4 Pro和Flash版本的主要区别是什么?

DeepSeek-V4 Pro总参数1.6T,每token激活49B,共61层;Flash总参数284B,激活13B,共43层。两者结构相同,但尺寸不同,均支持1M上下文。

DeepSeek-V4相比V3.2在推理效率和KV缓存上有何改进?

在1M上下文下,Pro单token推理的FLOPs仅为V3.2的27%,KV缓存仅为10%。

DeepSeek-V4的残差流结构有什么特点?

DeepSeek-V4采用4条残差流(mHC的hc_mult=4),每条维度为d。输入时复制4份,每个子层前后有mHC算子:读算子将4条流加权求和为子层输入,写算子将输出分回4条流,并通过双随机矩阵B进行混合。

DeepSeek-V4中CSA和HCA是如何交错的?

在Pro中,第0、1层为HCA,第2-59层偶数层为CSA、奇数层为HCA,第60层为CSA。Flash类似,但前两层为纯滑窗注意力。

DeepSeek-V4的MoE层有哪些改进?

MoE层有四个改动:打分函数改为sqrt(softplus),前三层使用hash routing,采用序列级平衡损失,以及SwiGLU激活截断。

DeepSeek-V4的优化器是什么?

DeepSeek-V4使用Muon优化器,并混合Newton-Schulz迭代,而V3和V3.2使用AdamW。

DeepSeek-V4的上下文长度和预训练数据量是多少?

DeepSeek-V4支持1M上下文,预训练token数为32T。

🏷️

标签

➡️

继续阅读