DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管制,但训练仍依赖英伟达。华为产能和软件生态是主要挑战,交付或需一年以上。
DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-gather处理跨rank压缩窗口。磁盘前缀缓存中,压缩条目易存,滑窗KV需重算或周期检查点。mHC通过融合内核、重算和DualPipe优化,将访存开销压至6.7%。
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash routing替代稠密层;增加极小序列级平衡损失;SwiGLU加硬截断防离群值。模型采用FP4量化,61层全MoE,每token激活6个expert,稀疏度64,总参数约49B。
该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和均为1),经Sinkhorn-Knopp迭代投影实现,使复合映射增益从3000降至1.6。初始化时等价于普通Transformer,参数量仅占0.005%,带来推理性能提升,并与Kimi K3的Attention Residuals形成对比。
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩导致近token不可见;Q/KV归一化替代QK-Clip;部分RoPE加输出反旋转消除绝对位置;attention sink解决softmax权重分配缺陷;1M上下文KV cache仅5.3GiB,FLOPs约38G。
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning indexer打分选择top-1024块。Indexer源自V3.2的DSA,采用64头128维、ReLU加权和FP4量化,通过KL散度模仿主注意力分布训练。V4将索引对象从token改为压缩块,query共享低秩latent。文章详述了indexer实现细节、一层CSA的完整维度流程及参数统计。
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维KV向量,采用重叠窗口和逐通道softmax加权,K与V共享单头,配合分组输出投影降低参数。相比前代,V4首次压缩缓存条目数,以支持1M上下文的高效推理。
本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与MoE结构。相比V3.2,推理FLOPs降至27%、KV缓存仅10%。文章提供层排布、维度对照表及参数明细,并预告后续将分篇详解各模块设计。
商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。
dsh-image-gen是DeepSeek Harness的AI图像插件,支持对话生图、连续编辑、Studio批量创作、多模型对比、500+Prompt灵感库及本地ComfyUI集成。用户可在聊天框内完成全流程图像操作,无需切换界面,支持BYOK模式,安装简单,五分钟内可出图。目前ComfyUI不支持Studio和多模型对比,是待完善点。
DeepSeek发布首个多模态实验模型V4-Flash-Vision-Exp,新增视觉理解能力,可处理图像图表等复杂任务,性能提升至36.5,多模态评测表现优异。HyperAI已上线部署教程,支持一键运行。
作者为DeepSeek Harness开发了dsh-discord适配器,将其接入Discord工作台。该插件支持@提及创建会话、流式渲染、按钮审批、会话控制及双语界面,强调安全设计(白名单、权限校验)。安装简单,通过dsh CLI添加,配置token即可使用。项目已发布至npm,代码开源,欢迎贡献。
GLM 5.3 Flash与DeepSeek V4 Flash在Hermes Agent实测对比:GLM跑分高但落地差,工具调用不稳、不守Agents.md规则;DeepSeek虽参数少、跑分低,但干活稳,被社区推荐为默认模型。文章指出评测与实战脱节,Agent场景更需“听话”模型,便宜非关键,能干活才是王道。
DeepSeek Harness(DSH)开源三周内连续发布alpha版本,进行底层重构,移除APIProxy并更换插件通信机制,导致5100多个插件面临兼容性问题。子代理现可独立配置模型,但架构剧烈变动使插件生态难以跟上,官方警告破坏性变更将持续,插件可能随时失效。
DeepSeek发布V4 Flash Vision Exp,支持图像输入,价格低于Gemini 3.7 Flash。测试显示两者在图表、发票和日志分析中准确率相当,均能识别陷阱。DeepSeek成本约为Gemini三分之一,但速度慢一倍多,且高峰期价格翻倍。建议批量处理选DeepSeek,实时任务用Gemini。
DSH Desktop是社区为DeepSeek Harness打造的开源桌面客户端,核心理念为“万物皆插件”,桌面本身作为普通插件集成。它免装环境,双击即用,两天获4700星,两周破两万。支持窗口、托盘、终端、Profile切换等功能,服务仅监听本地。社区已积累5100多插件,但性能争议存在,生态未来待观察。
dsh-subagents是DeepSeek Harness的插件,通过Markdown文件定义子代理角色,支持模型或CLI驱动、热加载和管理界面。它委派任务给廉价模型,降低推理成本达72%,保持主模型上下文清晰,并集成外部CLI工具,提升效率。
本文对比了四款AI代理基础设施:OpenClaw作为个人助理存在安全漏洞;Hermes Agent能自我改进但有沙箱绕过风险;WorkBuddy是腾讯闭源办公工具,机制不透明;DeepSeek Harness是开源平台,插件化设计可审计但生态尚早。选择需权衡功能与安全。
DeepSeek Harness是一个开源项目,其核心公式为Agent=模型+Harness,通过将模型与工具、循环等组件解耦,实现“一切皆插件”。它基于Cordis元框架,支持热插拔、可逆副作用和四种运行模式,并具备安全审批、日志记录和子Agent功能。尽管存在安全漏洞,但展示了AI自主扩展能力的潜力。
完成下面两步后,将自动完成登录并继续当前操作。