XPU如何成就世界级AI工厂

XPU如何成就世界级AI工厂

💡 原文英文,约1400词,阅读约需5分钟。
📝

内容提要

NVIDIA推出NVLink Fusion,将定制XPU与其成熟AI基础设施结合,帮助超大规模和AI原生公司构建灵活、可扩展的AI工厂。该方案提供高性能NVLink互联、成熟软件栈和供应链,降低开发风险,支持统一机架架构,实现高效部署和运营,满足大规模AI工作负载需求。

🔎

延伸解读

XPU落地为何难在平台而非芯片

文章指出,自研XPU的挑战远不止芯片设计本身,还包括高速互联、机架架构、冷却供电、软件栈和供应链整合等。这些环节的复杂性和成本常被低估,成为XPU快速上市的主要障碍。NVLink Fusion的思路正是将这部分成熟基础设施外包,让团队聚焦差异化创新,从而降低整体开发风险。

NVLink Fusion的互联性能优势

NVLink Fusion将XPU接入NVLink域,实现72个XPU的高带宽低延迟互联。相比基于以太网的方案,端到端延迟降低3倍,报文速率提升10倍。未来域规模可扩展至1152个加速器,并支持共封装光学。此外,NVLink-C2C连接XPU与CPU的能效是PCIe的6倍,有助于提升整体系统性能。

统一架构降低数据中心规划风险

AI工厂建设需提前规划电力、冷却和机架布局,但芯片选型可能延迟。NVLink Fusion通过统一架构,使XPU和GPU系统共享机架、网络、冷却和供电,运营商可先推进基建,再灵活调整硅片组合。这有助于避免因单一芯片锁定而导致的进度风险,并支持混合部署不同加速器。

工厂级运维与软件生态是关键

文章强调,AI工厂的运维效率直接影响成本。NVLink Fusion参考机架采用全液冷、无风扇设计,支持不停机维护。软件层面,NCCL、Dynamo、NIXL和Mission Control等工具实现集群管理、遥测和调试,确保混合基础设施协同运行。这些成熟组件降低了运营风险,提升了整体可用性。

Q&A

什么是NVLink Fusion?

NVLink Fusion是NVIDIA推出的一项技术,将定制XPU与NVIDIA的成熟AI基础设施相结合,使超大规模和AI原生公司能够构建灵活、可扩展的AI工厂。它提供高性能NVLink互联、成熟软件栈和供应链,降低开发风险,支持统一机架架构,实现高效部署和运营。

NVLink Fusion如何提升XPU的性能?

NVLink Fusion将XPU接入NVIDIA的NVLink scale-up域,第六代NVLink提供高带宽、低延迟的网络,支持72个XPU的域。相比基于现成以太网的方案,端到端延迟降低3倍,数据包速率提高10倍。此外,NVLink-C2C连接XPU与CPU,能效比PCIe接口高6倍。

NVLink Fusion如何帮助降低开发风险?

NVLink Fusion利用NVIDIA成熟的软件栈、供应链和机架架构,使开发团队无需从头构建整个平台。它提供了经过验证的组件和设计,如MGX机架架构和参考计算托盘,减少了集成和验证的复杂性,从而降低了开发风险并加快了上市时间。

NVLink Fusion支持哪些CPU架构?

NVLink Fusion允许客户选择CPU架构,包括NVIDIA Vera CPU或其他生态系统CPU,通过NVLink-C2C连接。这提供了灵活性,使客户能够根据工作负载需求选择最合适的CPU。

NVLink Fusion如何支持AI工厂的灵活部署?

NVLink Fusion采用统一架构,使XPU和GPU系统(如Vera Rubin NVL72)可以共享机架、网络、冷却、电源和管理系统。这样,运营商可以提前进行基础设施建设,同时推迟确定具体的硅片组合,并根据需求变化重新配置容量,从而实现灵活部署。

NVLink Fusion在软件方面提供了哪些支持?

NVLink Fusion支持NVIDIA的软件栈,包括NCCL用于分布式工作负载、NVIDIA Dynamo和NIXL用于资源解耦、NVIDIA Mission Control用于集群管理、遥测和调试。这些软件帮助运营商将混合AI基础设施作为协调系统运行。

NVLink Fusion如何与NVIDIA DSX参考架构结合?

NVLink Fusion与NVIDIA DSX参考架构对齐,该架构用于AI工厂的协同设计,包括建筑、电力、冷却、计算和网络。NVIDIA Omniverse DSX AI Factory Blueprint提供数字孪生和开放参考设计,使合作伙伴能够在部署前模拟设施和技术。

🏷️

标签

➡️

继续阅读