DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-gather处理跨rank压缩窗口。磁盘前缀缓存中,压缩条目易存,滑窗KV需重算或周期检查点。mHC通过融合内核、重算和DualPipe优化,将访存开销压至6.7%。
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash routing替代稠密层;增加极小序列级平衡损失;SwiGLU加硬截断防离群值。模型采用FP4量化,61层全MoE,每token激活6个expert,稀疏度64,总参数约49B。
该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和均为1),经Sinkhorn-Knopp迭代投影实现,使复合映射增益从3000降至1.6。初始化时等价于普通Transformer,参数量仅占0.005%,带来推理性能提升,并与Kimi K3的Attention Residuals形成对比。
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩导致近token不可见;Q/KV归一化替代QK-Clip;部分RoPE加输出反旋转消除绝对位置;attention sink解决softmax权重分配缺陷;1M上下文KV cache仅5.3GiB,FLOPs约38G。
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning indexer打分选择top-1024块。Indexer源自V3.2的DSA,采用64头128维、ReLU加权和FP4量化,通过KL散度模仿主注意力分布训练。V4将索引对象从token改为压缩块,query共享低秩latent。文章详述了indexer实现细节、一层CSA的完整维度流程及参数统计。
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维KV向量,采用重叠窗口和逐通道softmax加权,K与V共享单头,配合分组输出投影降低参数。相比前代,V4首次压缩缓存条目数,以支持1M上下文的高效推理。
本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与MoE结构。相比V3.2,推理FLOPs降至27%、KV缓存仅10%。文章提供层排布、维度对照表及参数明细,并预告后续将分篇详解各模块设计。
DeepSeek V4 Flash通过Autoprompt自动生成提示词,在Terminal-Bench 2.1测试中完成率从67.42%升至82.02%,提升14.61个百分点。Autoprompt规划、构建、测试、审查、修复提示词,减少人工翻译意图的循环,但耗时增3倍、Token翻倍。官方82.7分因框架不同不可直接比较,提升稳定性待验证。
DeepSeek宣布V4系列API新定价,采用峰谷错峰计价:高峰时段(9-12点、14-18点)价格翻倍,空闲时段减半。V4-Pro转正式商用,两款模型支持384K上下文及多种功能,旨在调节算力负载,提升服务稳定性。
作者使用DeepSeek V4 Pro改进PHP扩展Yaconf,实现子目录支持和compact存储。V4 Pro速度快、理解力强,但稳定性差:Edit失败超百次,一次git操作丢失核心代码,上下文压缩后遗忘决策。性能实测随机访问提升40%,内存降16%。作者认为V4 Pro虽快,但当前国内模型中Qwen3.8更稳妥。
AMD MI300X显卡成功运行3040亿参数的DeepSeek V4 Flash模型,实测单流解码168.6 tok/s,总吞吐达830 tok/s。但部署过程充满挑战,需修复FP8格式不兼容、MoE路由错误等问题,显存使用接近极限,系统脆弱,仅适合技术验证,不适合生产环境。
DeepSeek V4 Flash以极低价格提供高性能,7分钱生成3D游戏,5毛钱完成CS任务,性能接近Opus 4.8,成本仅为顶尖模型的百分之一。海外平台争相加码补贴,开发者大量使用,推动开源模型普及。文章认为这标志着AI应用黄金时代开启,并预告DeepSeek Code编程工具即将推出。
DeepSeek-V4-Flash正式版发布一周内登顶全球大模型调用量榜首,周调用量达7.1万亿Token,中国模型包揽前五。其Agent能力大幅提升,价格极低,单任务成本仅3美分,吸引海外开发者迁移,推理成本降60%-85%。分析认为,中国AI以性能与价格优势改写全球市场规则,冲击美国头部模型。
Reddit用户用24GB显存和96GB内存的电脑成功运行DeepSeek-V4-Flash-0731,引发硬件门槛讨论。量化技术和开源社区推动本地AI普及,虽速度慢且成本高,但提供隐私和掌控感。对比云服务,本地运行代表技术民主化趋势,未来可能成为主流。
DeepSeek发布V4 Flash编程模型,性能媲美Claude Opus 4.8,价格仅28美分,比后者便宜99%,引发七月AI价格战。OpenAI、Google等纷纷降价,Anthropic坚持高价。行业趋向“水电煤”化,智能路由器将按需分配模型,削弱品牌溢价。薄利多销或成主流,但利润可能从模型层转向应用层。
DeepSeek V4 Flash更新权重,代理能力显著增强,Terminal-Bench得分从56.9升至82.7。AI Gateway默认使用新权重,模型ID不变,代码无需修改。目前仅DeepSeek提供更新,其他供应商下周接入。用户可通过AI SDK设置模型,或在编码代理中配置使用。
K3缓存大因参数多(2.78万亿)及24层无压缩层,保细节;V4缓存小因全层压缩,靠工具补缺。两者取舍精度与速度,无绝对优劣,反映技术路线与资源选择差异。
DeepSeek V4引入CSA和HCA两种压缩注意力机制,以提高大模型处理超长上下文的效率。CSA通过分组压缩和稀疏选择保留更多细节,而HCA则实现极端压缩并对所有条目进行密集注意。两者结合使用,既保留重要信息,又降低计算成本。尽管效率提升显著,处理百万级token仍需高性能硬件,主要面向大规模推理场景。未来可能探索动态压缩率等新方向。
AI大语言模型竞争加剧,OpenAI提前发布GPT-6,性能显著提升。Anthropic即将推出Fable 5.1,注重安全性和复杂推理能力。国内DeepSeek的V4 GA版本已准备就绪,力争超越GLM-5.2。各大模型在参数、训练策略和上下文窗口等方面全面升级,未来几个月将迎来AI工具的质变。
完成下面两步后,将自动完成登录并继续当前操作。