每瓦特性能提升高达30倍:NVIDIA Vera Rubin NVL72为AI代理树立新效率标准

每瓦特性能提升高达30倍:NVIDIA Vera Rubin NVL72为AI代理树立新效率标准

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

NVIDIA Vera Rubin NVL72在代理式AI工作负载中,每兆瓦吞吐量比GB300 NVL72高30倍,每百万token成本低35倍。该平台通过软硬件协同设计,支持分离式服务、专家并行、KV缓存等优化,提升推理效率,适合大规模AI工厂部署。

🔎

延伸解读

代理式AI为何更耗算力

文章引用OpenRouter数据指出,代理式AI工作负载的token消耗量是简单聊天请求的15倍。这是因为AI代理在完成任务时会持续推理,不断查询数据库、搜索信息、调用子代理,并将累积的token作为下一步输入,导致上下文长度可达数十万token。这种模式在软件开发、客户服务、深度研究等场景中普遍存在,对基础设施的推理效率和长上下文处理能力提出了更高要求。

效率提升的关键技术

Vera Rubin NVL72通过软硬件协同设计实现效率飞跃,包括分离式服务(prefill和decode独立扩展)、大规模专家并行、分布式KV缓存和KV感知路由等优化。这些技术针对代理式AI的长上下文和动态请求特征,减少重复计算,提升GPU利用率。此外,NVFP4量化压缩模型权重,降低内存占用,而第六代NVLink提供高带宽低延迟通信,支撑大规模并行。

性能数据的测量背景

文中数据基于SemiAnalysis AgentX工作负载,使用真实代理编码会话记录,保留上下文增长、工具调用和子代理生成。结果尚未经过SemiAnalysis正式评审,且未包含Vera CPU在工具调用方面的性能。因此,这些早期数据可能低估或高估实际表现,读者在参考时应关注后续验证和软件优化带来的性能变化。

Q&A

NVIDIA Vera Rubin NVL72在代理式AI工作负载中,每兆瓦吞吐量比GB300 NVL72高多少倍?

根据NVIDIA的实测数据,Vera Rubin NVL72在代理式AI工作负载中,每兆瓦吞吐量比GB300 NVL72高30倍。

Vera Rubin NVL72相比GB300 NVL72,每百万token的成本降低了多少?

Vera Rubin NVL72相比GB300 NVL72,每百万token的成本降低了35倍。

为什么代理式AI工作负载比简单聊天请求消耗更多token?

代理式AI工作负载比简单聊天请求消耗更多token,因为代理需要执行多步骤任务,如查询数据库、搜索信息、调用子代理等,每一步都会产生token,且上下文不断累积,导致token消耗量大幅增加。

NVIDIA使用什么工作负载来测量Vera Rubin NVL72的性能?

NVIDIA使用SemiAnalysis AgentX工作负载进行测量,该工作负载包含录制的真实世界代理式编码会话,保留了实际的上下文增长、工具调用和子代理生成。

Vera Rubin NVL72采用了哪些软硬件协同设计技术来提升推理效率?

Vera Rubin NVL72采用了分离式服务、速率匹配、大规模专家并行、分布式KV缓存、KV缓存卸载、KV感知路由、融合CUDA内核(如MegaMoE)、第五代Tensor Core、第三代Transformer Engine、NVFP4量化等技术,并通过NVLink和NVLink Switch实现高带宽低延迟的GPU间通信。

Vera Rubin NVL72的每兆瓦吞吐量提升对AI工厂有什么实际意义?

对于受功耗限制的AI工厂,每兆瓦吞吐量提升30倍意味着在相同能耗下可以完成30倍的代理式AI工作,直接提高AI工厂的收入和利润空间。

Vera Rubin NVL72的完整平台包含哪些芯片?

Vera Rubin NVL72的完整平台是一个七芯片架构,包括NVIDIA Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX和ConnectX-9 SuperNIC。

🏷️

标签

➡️

继续阅读