内容提要
NVIDIA宣布Vera Rubin NVL72平台扩展,其Groq 3 LPX推理加速器已全面投产,在长上下文代理任务中实现每秒3400个输出令牌,性能提升4倍。该平台通过GPU与LPU协同设计,优化推理延迟和吞吐量,并获Nebius、CoreWeave等伙伴采用。同时,NVIDIA推出Spectrum-X Multiplane网络和Scale-In基础设施,以支持大规模代理AI工厂。
延伸解读
GPU与LPU协同设计:消除速度与吞吐的取舍
文章指出,NVIDIA Groq 3 LPX并非独立加速器,而是与Vera Rubin NVL72平台深度协同设计。Rubin GPU负责大规模上下文处理,LPX则加速延迟敏感的token生成,两者联合计算每一层模型,旨在消除传统上速度与吞吐量之间的权衡。这种“极端协同设计”理念强调从网络到计算的端到端优化,而非单一芯片的突破,反映了AI推理基础设施正从组件堆叠转向系统级整合。
长上下文与代理工作负载:推理性能的新标杆
在Artificial Analysis基准测试中,Groq 3 LPX在Gemma 4 31B模型上实现了每秒3400个输出token,针对10万token长上下文场景,性能比最接近的替代平台快4倍。这一数据凸显了代理式AI对长上下文和低延迟推理的极端需求。随着AI从训练转向推理和代理,token生成速度成为关键瓶颈,而该平台通过专门加速解码延迟,为大规模交互式应用提供了新的性能参考。
生态合作与网络扩展:构建AI工厂的完整拼图
文章提到多家合作伙伴的采用:Nebius成为首个采用Groq 3 LPX的AI云,CoreWeave部署Spectrum-X Multiplane网络,SpaceXAI计划使用Vera CPU。这些合作表明,NVIDIA不仅提供芯片,还通过Spectrum-X网络和Scale-In基础设施,构建从计算到网络的完整AI工厂方案。Spectrum-X Multiplane支持扩展到512,000个GPU,且单平面故障时仍保留约90%带宽,硬件恢复比软件快11倍,体现了网络层对大规模AI部署的关键支撑。
Q&A
NVIDIA Groq 3 LPX 在长上下文代理任务中的性能表现如何?
在 Artificial Analysis 基准测试中,使用 Gemma 4 31B 模型,NVIDIA Groq 3 LPX 在 100,000 token 长上下文场景下实现了每秒 3400 个输出 token,比最接近的替代平台快 4 倍。
NVIDIA Groq 3 LPX 与 Vera Rubin NVL72 是如何协同工作的?
Groq 3 LPX 是 Vera Rubin NVL72 平台的扩展,通过 GPU 和 LPU 的协同设计,Rubin GPU 负责大规模上下文处理,而 LPX 加速延迟敏感的 decode 工作负载,从而消除速度与吞吐量之间的传统权衡,提供更快、更可预测的 token 生成。
哪些公司采用了 NVIDIA Vera Rubin 平台?
SpaceXAI 宣布将使用 NVIDIA Vera CPU 为其下一代代理 AI 提供动力;CoreWeave 已部署 Spectrum-X Multiplane 以连接 NVIDIA Vera Rubin 机架;Nebius 是首个采用 NVIDIA Groq 3 LPX 的 AI 云。
NVIDIA Spectrum-X Multiplane 如何实现大规模 AI 工厂网络扩展?
Spectrum-X Multiplane 将每个服务器的网络连接拆分为多个独立的路径(平面),每个平面运行自己的轻量级两层网络,从而无需增加第三层网络即可扩展到 512,000 个 GPU。它通过 ConnectX SuperNIC 中的硬件引擎自动管理流量并绕过故障,在八平面拓扑中,即使一个平面故障,仍能保持约 90% 的总带宽,硬件恢复速度比软件快 11 倍。
NVIDIA Scale-In 基础设施的作用是什么?
NVIDIA Scale-In 是 NVIDIA AI 网络的第五大支柱,由 BlueField-4 和 DOCA 驱动,将加速能力扩展到安全、管理和运营 AI 工厂所需的基础设施服务,提供多租户网络、高性能存储访问、芯片内安全、弹性配置和实时可观测性,同时保持基础设施处理独立于主机计算资源。
NVIDIA NVLink Fusion 如何帮助构建半定制 AI 工厂?
NVLink Fusion 将自定义 XPU 和 CPU 连接到 NVIDIA 的扩展和纵向扩展技术栈,包括第六代 NVLink 和 NVLink Switch,以及 NVLink-C2C。通过 MGX 生态系统,采用者可以使用经过验证的机架设计、组件和软件,从而将数据中心建设与芯片就绪解耦,灵活调整 GPU 和 XPU 的比例。