小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DeepSeek-V4 模型结构(7):结构决定系统

DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-gather处理跨rank压缩窗口。磁盘前缀缓存中,压缩条目易存,滑窗KV需重算或周期检查点。mHC通过融合内核、重算和DualPipe优化,将访存开销压至6.7%。

DeepSeek-V4 模型结构(7):结构决定系统

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:20:00Z
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon

DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。

DeepSeek-V4 模型结构(6):优化器与稳定性,Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:00:00Z
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动

本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash routing替代稠密层;增加极小序列级平衡损失;SwiGLU加硬截断防离群值。模型采用FP4量化,61层全MoE,每token激活6个expert,稀疏度64,总参数约49B。

DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:40:00Z
DeepSeek-V4 模型结构(4):深度维度,mHC

该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和均为1),经Sinkhorn-Knopp迭代投影实现,使复合映射增益从3000降至1.6。初始化时等价于普通Transformer,参数量仅占0.005%,带来推理性能提升,并与Kimi K3的Attention Residuals形成对比。

DeepSeek-V4 模型结构(4):深度维度,mHC

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:20:00Z
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件

本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩导致近token不可见;Q/KV归一化替代QK-Clip;部分RoPE加输出反旋转消除绝对位置;attention sink解决softmax权重分配缺陷;1M上下文KV cache仅5.3GiB,FLOPs约38G。

DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T19:00:00Z
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择

本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning indexer打分选择top-1024块。Indexer源自V3.2的DSA,采用64头128维、ReLU加权和FP4量化,通过KL散度模仿主注意力分布训练。V4将索引对象从token改为压缩块,query共享低秩latent。文章详述了indexer实现细节、一层CSA的完整维度流程及参数统计。

DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T18:40:00Z
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV

本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维KV向量,采用重叠窗口和逐通道softmax加权,K与V共享单头,配合分组输出投影降低参数。相比前代,V4首次压缩缓存条目数,以支持1M上下文的高效推理。

DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T18:20:00Z
DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4

本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与MoE结构。相比V3.2,推理FLOPs降至27%、KV缓存仅10%。文章提供层排布、维度对照表及参数明细,并预告后续将分篇详解各模块设计。

DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T18:00:00Z
DeepSeek V4 Flash凭借一项编码技能,完成率飙升14.61%!

DeepSeek V4 Flash通过Autoprompt自动生成提示词,在Terminal-Bench 2.1测试中完成率从67.42%升至82.02%,提升14.61个百分点。Autoprompt规划、构建、测试、审查、修复提示词,减少人工翻译意图的循环,但耗时增3倍、Token翻倍。官方82.7分因框架不同不可直接比较,提升稳定性待验证。

DeepSeek V4 Flash凭借一项编码技能,完成率飙升14.61%!

极道 极道 · 2026-08-19T22:27:00Z
DeepSeek-V4系列API正式调价:首创峰谷计费,高峰期费用翻倍

DeepSeek宣布V4系列API新定价,采用峰谷错峰计价:高峰时段(9-12点、14-18点)价格翻倍,空闲时段减半。V4-Pro转正式商用,两款模型支持384K上下文及多种功能,旨在调节算力负载,提升服务稳定性。

DeepSeek-V4系列API正式调价:首创峰谷计费,高峰期费用翻倍

TechWeb 全站精华 TechWeb 全站精华 · 2026-08-17T00:52:06Z
用DeepSeek V4 Pro改进Yaconf:快是真快,但它把我代码搞丢了

作者使用DeepSeek V4 Pro改进PHP扩展Yaconf,实现子目录支持和compact存储。V4 Pro速度快、理解力强,但稳定性差:Edit失败超百次,一次git操作丢失核心代码,上下文压缩后遗忘决策。性能实测随机访问提升40%,内存降16%。作者认为V4 Pro虽快,但当前国内模型中Qwen3.8更稳妥。

用DeepSeek V4 Pro改进Yaconf:快是真快,但它把我代码搞丢了

风雪之隅 风雪之隅 · 2026-08-14T04:25:58Z
一张AMD MI300X卡跑DeepSeek V4 flash:总吞吐能干到830 tok/s

AMD MI300X显卡成功运行3040亿参数的DeepSeek V4 Flash模型,实测单流解码168.6 tok/s,总吞吐达830 tok/s。但部署过程充满挑战,需修复FP8格式不兼容、MoE路由错误等问题,显存使用接近极限,系统脆弱,仅适合技术验证,不适合生产环境。

一张AMD MI300X卡跑DeepSeek V4 flash:总吞吐能干到830 tok/s

极道 极道 · 2026-08-04T22:09:00Z
DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash

DeepSeek V4 Flash以极低价格提供高性能,7分钱生成3D游戏,5毛钱完成CS任务,性能接近Opus 4.8,成本仅为顶尖模型的百分之一。海外平台争相加码补贴,开发者大量使用,推动开源模型普及。文章认为这标志着AI应用黄金时代开启,并预告DeepSeek Code编程工具即将推出。

DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash

量子位 量子位 · 2026-08-04T08:18:45Z
DeepSeek-V4-Flash登顶全球调用量榜首,国产大模型包揽前五

DeepSeek-V4-Flash正式版发布一周内登顶全球大模型调用量榜首,周调用量达7.1万亿Token,中国模型包揽前五。其Agent能力大幅提升,价格极低,单任务成本仅3美分,吸引海外开发者迁移,推理成本降60%-85%。分析认为,中国AI以性能与价格优势改写全球市场规则,冲击美国头部模型。

DeepSeek-V4-Flash登顶全球调用量榜首,国产大模型包揽前五

TechWeb 全站精华 TechWeb 全站精华 · 2026-08-04T00:54:44Z
24GB显存Windows电脑上竟然跑起了DeepSeek-V4-Flash-0731?

Reddit用户用24GB显存和96GB内存的电脑成功运行DeepSeek-V4-Flash-0731,引发硬件门槛讨论。量化技术和开源社区推动本地AI普及,虽速度慢且成本高,但提供隐私和掌控感。对比云服务,本地运行代表技术民主化趋势,未来可能成为主流。

24GB显存Windows电脑上竟然跑起了DeepSeek-V4-Flash-0731?

极道 极道 · 2026-08-03T23:33:00Z

DeepSeek发布V4 Flash编程模型,性能媲美Claude Opus 4.8,价格仅28美分,比后者便宜99%,引发七月AI价格战。OpenAI、Google等纷纷降价,Anthropic坚持高价。行业趋向“水电煤”化,智能路由器将按需分配模型,削弱品牌溢价。薄利多销或成主流,但利润可能从模型层转向应用层。

DeepSeek V4 Flash降价99%加速AI向零成本迈进

极道 极道 · 2026-08-03T03:41:00Z
DeepSeek V4 Flash现已在AI Gateway上运行更新权重

DeepSeek V4 Flash更新权重,代理能力显著增强,Terminal-Bench得分从56.9升至82.7。AI Gateway默认使用新权重,模型ID不变,代码无需修改。目前仅DeepSeek提供更新,其他供应商下周接入。用户可通过AI SDK设置模型,或在编码代理中配置使用。

DeepSeek V4 Flash现已在AI Gateway上运行更新权重

Vercel News Vercel News · 2026-07-31T07:00:00Z
Kimi K3缓存为何比DeepSeek V4大,2.78万亿参数与24层无压缩层的真相

K3缓存大因参数多(2.78万亿)及24层无压缩层,保细节;V4缓存小因全层压缩,靠工具补缺。两者取舍精度与速度,无绝对优劣,反映技术路线与资源选择差异。

Kimi K3缓存为何比DeepSeek V4大,2.78万亿参数与24层无压缩层的真相

极道 极道 · 2026-07-28T10:26:00Z
DeepSeek V4的CSA和HCA:如何把百万上下文压缩到不烧显卡

DeepSeek V4引入CSA和HCA两种压缩注意力机制,以提高大模型处理超长上下文的效率。CSA通过分组压缩和稀疏选择保留更多细节,而HCA则实现极端压缩并对所有条目进行密集注意。两者结合使用,既保留重要信息,又降低计算成本。尽管效率提升显著,处理百万级token仍需高性能硬件,主要面向大规模推理场景。未来可能探索动态压缩率等新方向。

DeepSeek V4的CSA和HCA:如何把百万上下文压缩到不烧显卡

极道 极道 · 2026-07-12T00:48:00Z
大模型军备竞赛升级:GPT-6/Fable 5.1/V4 GA三强争霸

AI大语言模型竞争加剧,OpenAI提前发布GPT-6,性能显著提升。Anthropic即将推出Fable 5.1,注重安全性和复杂推理能力。国内DeepSeek的V4 GA版本已准备就绪,力争超越GLM-5.2。各大模型在参数、训练策略和上下文窗口等方面全面升级,未来几个月将迎来AI工具的质变。

大模型军备竞赛升级:GPT-6/Fable 5.1/V4 GA三强争霸

极道 极道 · 2026-07-09T00:55:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码