内容提要
NVIDIA推出NVLink Fusion,将定制XPU与其成熟AI基础设施结合,帮助超大规模和AI原生公司构建灵活、可扩展的AI工厂。该方案提供高性能NVLink互联、成熟软件栈和供应链,降低开发风险,支持统一机架架构,实现高效部署和运营,满足大规模AI工作负载需求。
延伸解读
XPU落地为何难在平台而非芯片
文章指出,自研XPU的挑战远不止芯片设计本身,还包括高速互联、机架架构、冷却供电、软件栈和供应链整合等。这些环节的复杂性和成本常被低估,成为XPU快速上市的主要障碍。NVLink Fusion的思路正是将这部分成熟基础设施外包,让团队聚焦差异化创新,从而降低整体开发风险。
NVLink Fusion的互联性能优势
NVLink Fusion将XPU接入NVLink域,实现72个XPU的高带宽低延迟互联。相比基于以太网的方案,端到端延迟降低3倍,报文速率提升10倍。未来域规模可扩展至1152个加速器,并支持共封装光学。此外,NVLink-C2C连接XPU与CPU的能效是PCIe的6倍,有助于提升整体系统性能。
统一架构降低数据中心规划风险
AI工厂建设需提前规划电力、冷却和机架布局,但芯片选型可能延迟。NVLink Fusion通过统一架构,使XPU和GPU系统共享机架、网络、冷却和供电,运营商可先推进基建,再灵活调整硅片组合。这有助于避免因单一芯片锁定而导致的进度风险,并支持混合部署不同加速器。
工厂级运维与软件生态是关键
文章强调,AI工厂的运维效率直接影响成本。NVLink Fusion参考机架采用全液冷、无风扇设计,支持不停机维护。软件层面,NCCL、Dynamo、NIXL和Mission Control等工具实现集群管理、遥测和调试,确保混合基础设施协同运行。这些成熟组件降低了运营风险,提升了整体可用性。
Q&A
什么是NVLink Fusion?
NVLink Fusion是NVIDIA推出的一项技术,将定制XPU与NVIDIA的成熟AI基础设施相结合,使超大规模和AI原生公司能够构建灵活、可扩展的AI工厂。它提供高性能NVLink互联、成熟软件栈和供应链,降低开发风险,支持统一机架架构,实现高效部署和运营。
NVLink Fusion如何提升XPU的性能?
NVLink Fusion将XPU接入NVIDIA的NVLink scale-up域,第六代NVLink提供高带宽、低延迟的网络,支持72个XPU的域。相比基于现成以太网的方案,端到端延迟降低3倍,数据包速率提高10倍。此外,NVLink-C2C连接XPU与CPU,能效比PCIe接口高6倍。
NVLink Fusion如何帮助降低开发风险?
NVLink Fusion利用NVIDIA成熟的软件栈、供应链和机架架构,使开发团队无需从头构建整个平台。它提供了经过验证的组件和设计,如MGX机架架构和参考计算托盘,减少了集成和验证的复杂性,从而降低了开发风险并加快了上市时间。
NVLink Fusion支持哪些CPU架构?
NVLink Fusion允许客户选择CPU架构,包括NVIDIA Vera CPU或其他生态系统CPU,通过NVLink-C2C连接。这提供了灵活性,使客户能够根据工作负载需求选择最合适的CPU。
NVLink Fusion如何支持AI工厂的灵活部署?
NVLink Fusion采用统一架构,使XPU和GPU系统(如Vera Rubin NVL72)可以共享机架、网络、冷却、电源和管理系统。这样,运营商可以提前进行基础设施建设,同时推迟确定具体的硅片组合,并根据需求变化重新配置容量,从而实现灵活部署。
NVLink Fusion在软件方面提供了哪些支持?
NVLink Fusion支持NVIDIA的软件栈,包括NCCL用于分布式工作负载、NVIDIA Dynamo和NIXL用于资源解耦、NVIDIA Mission Control用于集群管理、遥测和调试。这些软件帮助运营商将混合AI基础设施作为协调系统运行。
NVLink Fusion如何与NVIDIA DSX参考架构结合?
NVLink Fusion与NVIDIA DSX参考架构对齐,该架构用于AI工厂的协同设计,包括建筑、电力、冷却、计算和网络。NVIDIA Omniverse DSX AI Factory Blueprint提供数字孪生和开放参考设计,使合作伙伴能够在部署前模拟设施和技术。