内容提要
华为发布昇腾960芯片及超节点,算力大幅提升,计划一年一代快速演进。推出NPO光互联技术Hi-ONE,降低功耗,提升系统可用度。CANN生态开源,开发者超5200人。华为定位算力底座,支持中国大模型企业,目标百万卡集群,应对先进制程限制。
延伸解读
从单芯片到系统工程:华为的算力竞争逻辑
文章指出,AI算力竞争已进入系统工程阶段,单颗芯片性能强并不代表系统能长期稳定运行。华为将竞争战线扩大到超节点、光互联、供电、散热和软件协同,通过4096卡超节点和统一内存编址,让多颗NPU更接近一台逻辑计算机。这种思路是在先进制程受限背景下,用系统级优化放大整体算力效率,而非只追求单点芯片突破。
NPO光互联:为何是当前工程最优解
华为在昇腾960超节点上采用NPO近封装光学,用约5500个Hi-ONE光引擎替代约4.8万个800G光模块,功耗降低超过550kW,系统可用度达99.8%。文章解释,华为没有直接转向CPO,是因为CPO在可靠性、良率和维护成本上尚未达到大规模商用条件,而NPO的TCO至少比CPO低40%以上。这体现了华为在技术选择上兼顾性能与工程可行性的务实态度。
CANN生态跨过拐点:开源与前置适配
CANN进入常态化开源社区运营,月活开发者超过5200人,外部开发者占比61%,昇腾也进入PyTorch官方支持路线。汪涛称“只敢说CANN生态跨过了拐点”,并计划在模型预训练阶段就与厂商协同,提前完成适配和性能优化。这意味着华为正从被动迁移转向主动融入模型开发流程,以降低开发者使用门槛,推动更多模型基于昇腾原生训练。
百万卡集群:技术上限与现实约束
华为披露,多超节点通过灵衢网络或RoCE扩展,二层Clos组网最大可到51.2万卡,结合多轨道拓扑技术上限可支持百万卡。但汪涛强调,百万卡更多是技术指标,现实部署仍要看投资、电力和模型需求。华为的真正目标是让算力“触手可及”,并通过技术专家团队支持客户做昇腾原生预训练。这提醒读者,技术上限与商业落地之间仍有距离。
Q&A
华为昇腾960芯片的性能参数有哪些提升?
昇腾960DT单芯片算力实现倍增,支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9.6TB/s。相比上一代,算力、内存容量和带宽继续往上推,且研发进度比原计划提前三个季度。
华为为什么选择NPO光互联而不是CPO?
华为认为CPO的可靠性、良率、成本和维护尚未达到大规模商用状态。CPO把光引擎和主芯片放一起,光引擎坏了整个主芯片就报废,可用度差,故障成本极高。当前NPO的TCO至少比CPO低40%以上,是工程、成本各方面综合最佳选择。未来若CPO解决可靠性、良率问题,华为也可能转向CPO。
华为昇腾960超节点在系统层面有哪些优势?
昇腾960超节点做到4096张NPU卡,最高8EFLOPS FP8算力、超过1PB HBM容量。通过跨物理节点的统一内存编址,让多颗NPU互联更接近一台逻辑计算机。在同样十万卡集群下,4096卡超节点组成的集群相对传统八卡服务器组成的集群,MFU可提升2.75倍。使用约5500个Hi-ONE替代约4.8万个800G光模块,功耗降低超过550kW,系统无故障运行时间提升一倍,系统可用度为99.8%。
华为CANN生态目前发展情况如何?
CANN进入常态化开源社区运营,月活开发者超过5200人,外部开发者占比达到61%;昇腾也进入PyTorch官方支持路线,开发者可以直接在PyTorch社区获得相关支持。汪涛表示经过八年努力,CANN生态跨过了拐点。
华为在AI算力领域的定位和使命是什么?
华为的核心使命是打造算力底座,为模型厂商和互联网公司提供算力支撑。华为希望把更多资源放在芯片、互联、系统和软件底座上,并不打算在每一层都和伙伴竞争。盘古会继续服务华为自身产品智能化,灵衢协议已经开放,CANN代码也持续开源。华为希望做中国大模型企业的底座和后盾,把他们托得越高,中国AI竞争力越强。
华为如何应对先进制程限制?
华为一边继续提升单芯片性能,一边把大量资源投入到超节点、光互联和系统工程。在现有工艺条件下,通过封装、互联、光通信、系统架构和软件协同等多层优化,尽可能放大整体算力效率,缩小与国际领先AI芯片和计算系统之间的差距。汪涛表示,到2030年甚至未来,中国最先进的制造工艺还没有取得完全突破,华为必须有一个创新路线,同时满足中国AI训练、推理、行业应用的需求。