内容提要
DeepSeek的核心优势在于其基础设施(Infra)能力,而非仅算法创新。其母公司幻方量化自2019年起投入巨资自建超算平台,积累了深厚工程经验。DeepSeek团队通过自研3FS文件系统、DualPipe算法等,以极低成本高效训练模型,获全球顶尖同行认可。公司正将Infra能力扩展至物理基建,建设大型数据中心,追求总体拥有成本最优,Infra在组织内主导模型架构决策。
延伸解读
Infra主导的模型架构决策
文章指出,DeepSeek的组织架构中,Infra团队对模型结构有巨大影响力。例如,公司一开始就采用MoE(混合专家模型),这在算法人员眼中是降本手段,不直接提升模型能力上限,但DeepSeek仍坚持这一选择,说明模型架构的决策首先考虑的是在Infra上运行的效率。这种由基础设施主导的决策逻辑,与许多大公司中算法主导的模式形成对比,反映了DeepSeek独特的工程文化。
从软件优化到物理基建的延伸
DeepSeek的Infra能力不仅体现在软件层面,如自研3FS文件系统和DualPipe算法,还延伸至物理基建。据报道,公司计划在内蒙古乌兰察布建设约1吉瓦的大型AI数据中心,并大规模招聘土木、电气、暖通等专业人才。这表明DeepSeek正追求从机房散热到电力成本的总体拥有成本(TCO)最优,将AI竞赛的战场从模型参数扩展至基础设施层面。
工程积累的长期价值
DeepSeek的Infra实力源于母公司幻方量化在量化交易时代的长期积累。自2019年起,幻方投入巨资自建超算平台,从硬件到软件全栈掌控,这种工程文化被完整继承。文章强调,DeepSeek的低成本训练和高效推理并非偶然,而是十年工程底蕴的结果。这提示读者,AI领域的竞争优势可能更多来自基础设施的长期投入和优化,而非短期的算法突破。
Q&A
DeepSeek的核心优势是什么?
DeepSeek的核心优势在于其基础设施(Infra)能力,而非仅算法创新。
幻方量化在DeepSeek的Infra能力形成中扮演了什么角色?
幻方量化是DeepSeek的母公司,自2019年起投入巨资自建超算平台,积累了深厚的工程经验,这些经验被DeepSeek继承。
DeepSeek自研了哪些关键基础设施技术?
DeepSeek自研了3FS并行文件系统、DualPipe算法和推理加速框架DSpark。
DeepSeek如何实现低成本训练模型?
DeepSeek通过自研的Infra技术(如3FS、DualPipe)和工程优化,以极低成本高效训练模型,例如V3模型仅用2048块H800 GPU和557.6万美元完成训练。
DeepSeek的Infra团队在组织中的地位如何?
DeepSeek的Infra团队在组织中有主导地位,Infra工程师数量多于算法工程师,且Infra团队在模型架构决策中具有巨大影响力。
DeepSeek在物理基础设施方面有什么新动作?
DeepSeek计划在内蒙古乌兰察布建设一座约1吉瓦的大型AI数据中心,并招聘土木、电气、暖通等人才,以追求总体拥有成本最优。
vLLM核心维护者如何评价DeepSeek的Infra团队?
vLLM核心维护者游凯超评价DeepSeek的Infra团队为“全球顶级”,并指出DeepSeek在推理引擎方面比vLLM走得更前。