本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与MoE结构。相比V3.2,推理FLOPs降至27%、KV缓存仅10%。文章提供层排布、维度对照表及参数明细,并预告后续将分篇详解各模块设计。
本研究提出了一种“压缩注意力”机制,以应对长输入提示对大语言模型推理效率的挑战。通过优化固定上下文,显著提高了推理速度,实验结果显示速度提升超过4倍,同时保持了较低的准确性损失。
完成下面两步后,将自动完成登录并继续当前操作。