DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态

DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态

💡 原文中文,约2400字,阅读约需6分钟。
📝

内容提要

DeepSeek在昇腾平台开源了TileLang编译工具、DeepGEMM等高性能算子库及DeepEP通信库等基础设施组件,与GPU版对应。华为提供超节点组网方案,实测通信带宽接近硬件上限。双方联合成果在CANN社区开源,支持DeepSeek模型部署与训练,推理性能显著提升,共同推动国产AI软件生态建设。

🔎

延伸解读

开源组件与GPU版对应,降低迁移门槛

DeepSeek此次开源的昇腾组件包括TileLang编译工具、DeepGEMM、FlashMLA、TileKernel、DeepSelect等算子库及DeepEP通信库,与此前GPU平台开源组件一一对应。这种对应关系意味着开发者可以沿用已有的编程习惯和优化经验,减少因平台切换带来的学习成本,为昇腾平台吸引更广泛的开发者群体提供了基础。

超节点组网与通信性能接近硬件上限

华为提供的SuperPoD Flex和UBL128组网方案支持128卡3.2Tbps单层交换和256K卡两层交换,配合ASC-COMM通信库,DeepSeek开发的DeepEP通信库实测Dispatch带宽375 GB/s、Combine带宽347 GB/s,接近硬件上限。这表明昇腾在超大规模集群互联方面已具备支撑前沿模型训练和低时延推理的通信能力。

推理性能数据揭示部署优化空间

基于EP32部署策略,DeepSeek-V4.1-Flash在offline推理模式下,TPOT=5ms时每卡输出吞吐2469 tokens/s,TPOT=10ms时可达5102 tokens/s。这些数据基于纯模型性能采集,不含Serving调度和框架负载均衡影响,实际部署中需结合框架开销综合评估,但为开发者提供了性能基线参考。

CANN社区开源成果覆盖全链路场景

华为将联合创新成果在CANN社区开源,涵盖大EP低延时推理、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL等场景。这些资源为开发者提供了从推理到训练的全链路参考实践,有助于加速基于昇腾950及超节点集群的DeepSeek模型部署与优化。

❓

Q&A

DeepSeek在昇腾平台开源了哪些基础设施组件?

DeepSeek开源了TileLang高级语言编译工具、DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能算子库组件,以及DeepEP分布式通信库。

华为为DeepSeek提供了怎样的昇腾超节点组网方案?

华为提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,支持超低时延推理和大规模训练。

DeepEP通信库的实测通信性能如何?

DeepEP通信库的互联带宽实测达到Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限。

基于昇腾平台部署DeepSeek模型,推理性能有哪些提升?

在EP32部署策略下,offline推理模式中DeepSeek-V4.1-Flash纯模型性能可实现TPOT=5ms时每卡输出吞吐2469 tokens/s,TPOT=10ms时每卡输出吞吐5102 tokens/s。

华为将联合创新成果开源在哪个社区?包含哪些内容?

华为将成果开源在CANN社区,包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。

昇腾平台为开发者提供了哪些编程接口支持?

昇腾提供了稳定、开放的Ascend C API接口,以及开放Ascend C编程接口与PTO ISA底层指令体系,支持TileLang等高级语言编译对接,兼顾手工调优和高级语言开发。

🏷️

标签

➡️

继续阅读