NVIDIA Vera Rubin 驱动每瓦性能,为全球合作伙伴带来最低Token成本

NVIDIA Vera Rubin 驱动每瓦性能,为全球合作伙伴带来最低Token成本

💡 原文英文,约2000词,阅读约需8分钟。
📝

内容提要

NVIDIA Vera Rubin平台正式量产,通过芯片到电网的协同设计实现每瓦性能领先和最低Token成本。CoreWeave基准测试显示其吞吐量较Grace Blackwell提升10倍。该平台获全球300多家合作伙伴部署,包括Google Cloud、Microsoft Azure等,并支持欧洲主权AI发展,同时Vera CPU在代理工作负载中表现优异。

🔎

延伸解读

每瓦性能成为AI工厂核心指标

文章强调,在电力受限的AI工厂中,每瓦性能(tokens per megawatt)是决定能否盈利扩展的关键。CoreWeave的基准测试显示,Vera Rubin NVL72的吞吐量是Grace Blackwell NVL72的10倍,这意味着在相同电力下可处理更多token,或相同负载消耗更少电力。这一指标直接关系到AI基础设施的经济性,是衡量新一代平台价值的重要参考。

极端协同设计带来的工程优势

Vera Rubin平台通过跨七个芯片和五个机架的极端协同设计,实现了系统级优化,而非简单组装现成部件。例如,无电缆、风扇或软管的机架设计将组装时间从数小时缩短至一分钟,45摄氏度液冷入口温度支持无冷水机干冷却器运行,节省大量水资源。这些工程创新不仅提升性能,还降低了部署和维护成本。

欧洲主权AI的落地路径

文章指出,欧洲希望在本土法律和管控下运行先进AI,而Vera Rubin为这一目标提供了计算基础。微软与Mistral的合作将开放模型与云及客户控制环境结合,使政府和受监管行业能按自身条件采用AI。这体现了主权AI并非要在创新、经济性和控制之间取舍,而是可以通过合适的硬件和软件架构同时实现。

CPU在代理工作负载中的关键作用

随着AI代理承担更复杂的推理、规划和工具使用,CPU性能对协调模型调用愈发重要。DeepInfra的基准测试显示,NVIDIA Vera CPU比替代CPU快2.2倍,并支持多1.6倍的并发代理,同时保持服务质量。这表明在代理时代,CPU不再是配角,而是影响整体效率和成本的关键组件。

Q&A

NVIDIA Vera Rubin平台相比Grace Blackwell在性能上有什么提升?

根据CoreWeave的基准测试,Vera Rubin NVL72在DeepSeek-R1上的吞吐量比Grace Blackwell NVL72提升了10倍,即每兆瓦的token数增加了10倍。

NVIDIA Vera Rubin平台如何实现每瓦性能领先和最低Token成本?

通过芯片到电网的协同设计,包括七个芯片和五个机架托盘作为一个系统设计,以及第六代NVLink、Spectrum-X以太网和NVIDIA Photonics等技术,实现了高带宽、低延迟和高能效,从而降低每token成本。

NVIDIA Vera Rubin平台有哪些合作伙伴?

全球有300多家合作伙伴,包括CoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud Infrastructure、Mistral、SpaceXAI、Tesla、Lambda等。

NVIDIA Vera Rubin平台如何支持欧洲的主权AI发展?

通过微软和Mistral的合作,提供基于Vera Rubin的AI基础设施,支持开放模型和客户控制的环境,满足欧洲对数据控制、治理和战略自主的需求。

NVIDIA Vera CPU在代理工作负载中表现如何?

DeepInfra的基准测试显示,Vera CPU比替代CPU快2.2倍,支持多达1.6倍的并发AI代理,同时保持相同的服务质量,并提高基础设施利用率和成本效率。

NVIDIA Vera Rubin NVL72在散热和组装方面有什么创新?

Vera Rubin NVL72系统在托盘内无电缆、风扇或软管,组装时间从数小时缩短到一分钟。45摄氏度液体冷却入口温度设计允许无冷水机干冷却器运行,新AI工厂每年每兆瓦可节省数百万加仑水。

NVIDIA Vera Rubin平台如何支持大规模强化学习?

Vera Rubin NVL72提供260 TB/s的NVLink 6全对全互连,使机架作为单一加速器,支持大规模并行环境中的强化学习,如Ineffable Intelligence的超级学习系统。

🏷️

标签

➡️

继续阅读