内容提要
在AI Infra峰会上,英伟达展示Vera Rubin与DSX平台,聚焦每瓦Token效率。DSX MaxLPS使Lambda能效提升23%、吞吐增24%;Vera Rubin NVL72搭配Groq 3 LPX,每兆瓦吞吐最高提升35倍。Emerald AI与硅谷电力验证柔性负载,Vera CPU获多家初创好评,NVLink 6保障大规模可靠性。
延伸解读
从峰值性能到每兆瓦Token:AI工厂的度量转向
文章指出,AI基础设施的衡量标准正从峰值性能转向经过验证的每兆瓦代理Token数。这意味着AI工厂需要从芯片到电网进行协同设计,而不仅仅是堆叠算力。英伟达通过DSX MaxLPS、NVLink等技术,旨在让每兆瓦电力产生更多Token,从而提升AI工厂的经济价值。这一转变对运营商的电力规划和投资回报评估具有实际影响。
柔性负载:AI工厂如何成为电网的调节资源
Emerald AI与硅谷电力合作验证了AI工厂的柔性负载计划。通过DSX Flex,AI工厂可以接收电网的减载请求、需求响应事件和价格信号,并自动调整能耗:优先保障关键任务,暂停低优先级任务,随后恢复。这使AI工厂能够作为灵活的电网资源,在电网需要时减少需求,同时保护关键AI工作负载,从而可能释放更多电网容量。
DSX MaxLPS实测:能效与吞吐的双重提升
Lambda在Blackwell服务器上首次验证了DSX MaxLPS。该技术持续监控GPU和机架的功耗,动态转移电力,回收静态分配下未使用的容量。实测中,Lambda在原本16个全功率节点的电力预算内运行了19个节点,集群Token吞吐量提升24%(从约400万到500万Token/秒),每瓦性能提升23%。对于下一代Vera Rubin NVL72,在合适部署环境下,DSX MaxLPS可在相同兆瓦预算内增加最多40%的GPU容量。
代理AI工作负载的基准测试:AgentX与能效经济
SemiAnalysis AgentX基于真实代理编码会话测量推理性能,保留了上下文增长、工具调用延迟和子代理生成等特征。Vera Rubin NVL72在DeepSeek V4 Pro模型上,每兆瓦吞吐量比GB300 NVL72提升高达30倍,每百万Token成本降低高达45倍。代理工作负载的Token量约为简单聊天请求的15倍,且输入输出长度变化大,因此需要基于完整代理轨迹的基准测试。这些效率提升直接转化为AI工厂的经济效益。
Q&A
英伟达在AI Infra峰会上展示了哪些主要平台和进展?
英伟达展示了Vera Rubin与DSX平台,聚焦每瓦Token效率。具体包括:DSX MaxLPS使Lambda能效提升23%、吞吐增24%;Vera Rubin NVL72搭配Groq 3 LPX,每兆瓦吞吐最高提升35倍;Emerald AI与硅谷电力验证柔性负载;Vera CPU获多家初创好评;NVLink 6保障大规模可靠性。
NVIDIA DSX MaxLPS如何提升AI工厂的能效?
DSX MaxLPS持续监控GPU和机架的功耗,动态转移可用电力到最需要的地方,回收静态配置未使用的容量。它优化混合工作负载的电力分配,使Lambda在相同电力预算下运行19个节点(通常16个全功率节点),集群Token吞吐量增加24%(从约400万到500万Token/秒),每瓦性能提升23%。对于下一代Vera Rubin NVL72,在相同兆瓦预算下可增加最多40%的GPU容量。
Vera Rubin NVL72搭配Groq 3 LPX在Token吞吐量上有什么提升?
Vera Rubin NVL72搭配Groq 3 LPX,每兆瓦Token吞吐量比GB200 NVL72最高提升35倍,适用于2万亿以上参数模型的长上下文场景。在100K上下文的Qwen 3.8 27B工作负载上,Groq 3 LPX达到每用户每秒2,529个输出Token。
Emerald AI与硅谷电力合作的柔性负载项目是什么?
Emerald AI与英伟达合作,在硅谷电力展示了商业AI工厂柔性负载项目。系统成功响应了硅谷电力的数百个需求信号,同时保护AI工作负载性能。Emerald AI计划使用NVIDIA DSX Flex为其Conductor电网响应电源管理软件,根据实时电网信号和混合能源动态调整AI工厂能耗,自动降低低优先级AI任务的电力,然后恢复正常。
NVIDIA Vera CPU在初创公司中获得了哪些性能评价?
多家初创公司对Vera CPU进行了测试并给予好评:Perplexity显示沙箱启动速度提升1.9倍;Daytona称在代理工作负载中有“显著提升”;ClickHouse在ClickBench上测得Vera是最快机器;DeepInfra显示编排步骤延迟降低2.2倍;Prime Intellect发现高带宽和低延迟;Redpanda测得延迟降低5.5倍、吞吐量提高73%;Starburst查询吞吐量提升3倍;Kinetica分析查询性能提升2.7倍。
NVIDIA NVLink 6如何保障大规模AI工厂的可靠性?
NVLink 6采用多层弹性架构,在故障影响应用前检测、遏制和恢复。物理层通过自定义前向纠错、物理层重试和通用物理层恢复保持无损结构,最小化延迟影响。网络层通过基于信用的流控、动态路由和链路重平衡在本地遏制故障,防止级联停顿降低AI工厂吞吐量。