内容提要
英伟达Vera Rubin NVL72在MLPerf Inference v6.1首次预览提交中领先,吞吐量最高达GB300 NVL72的3.7倍。GB300 NVL72四机架288 GPU实现99%扩展效率,软件优化较v6.0提升最高1.6倍。
延伸解读
预览成绩的参考价值与局限
Vera Rubin NVL72 的 MLPerf Inference v6.1 成绩属于首次预览提交,并非正式发布结果。文章明确提到这些是早期数据,后续会通过持续软件优化进一步提升。因此,读者在评估其实际性能时,需注意预览成绩可能不代表最终商用系统的表现,且部分优化在提交截止后仍在进行,尚未经 MLCommons 验证。
扩展效率对推理经济性的意义
GB300 NVL72 在四机架 288 GPU 配置下实现 99% 的扩展效率,意味着增加硬件几乎能线性提升吞吐量。文章指出,若扩展效率低下,基础设施成本将远超性能回报。高扩展效率依赖机架内高带宽低延迟互连、机架间网络以及高效的请求编排,这些因素共同决定了大规模推理部署的性价比。
软件优化是持续降本的关键
从 v6.0 到 v6.1,GB300 NVL72 在 Qwen3-VL 上的性能提升最高达 1.6 倍,主要来自降低 KV 缓存精度、内核融合、改进内核以及采用 vLLM 与 NVIDIA Dynamo 的分离式服务。文章还提到提交截止后仍有未经验证的进一步优化。这表明软件迭代能持续释放硬件潜力,延长基础设施的投资回报周期。
代理式推理对评测标准的新要求
文章提到 AI 代理需要多步推理、规划和行动,正在改变推理性能的衡量方式。在 SemiAnalysis AgentX 预览测试中,Vera Rubin NVL72 性能达到 GB300 NVL72 的 30 倍。同时,即将推出的 MLPerf Endpoints 基准将为代理式推理工作负载提供标准化测量,弥补传统吞吐量基准的不足。这提示读者关注评测标准演进对硬件选型的影响。
Q&A
英伟达Vera Rubin NVL72在MLPerf Inference v6.1中的首次亮相表现如何?
在MLPerf Inference v6.1的首次预览提交中,Vera Rubin NVL72相比GB300 NVL72实现了最高3.7倍的吞吐量提升。
GB300 NVL72在MLPerf Inference v6.1中的扩展效率如何?
GB300 NVL72在四机架288 GPU配置下实现了99%的扩展效率,吞吐量从单机架基线近乎线性增长。
英伟达在MLPerf Inference v6.1中的软件优化带来了多少性能提升?
软件优化使GB300 NVL72在Qwen3-VL上的性能比v6.0最高提升1.6倍,优化措施包括降低KV缓存精度、内核融合、改进内核以及使用vLLM和NVIDIA Dynamo进行解耦服务。
Vera Rubin NVL72在哪些基准测试中展示了领先性能?具体提升幅度是多少?
Vera Rubin NVL72在DeepSeek-R1和Qwen3-VL两个基准测试中展示了领先性能。在Qwen3-VL上,使用vLLM和NVIDIA Dynamo,吞吐量比GB300 NVL72最高提升3.7倍;在DeepSeek-R1上,使用TensorRT-LLM,吞吐量最高提升2.5倍。
Vera Rubin NVL72在AI代理工作负载上的性能如何?
在SemiAnalysis AgentX预览测试中,Vera Rubin NVL72的性能比GB300 NVL72提升了30倍。
英伟达的合作伙伴在MLPerf Inference v6.1中的参与情况如何?
共有19家合作伙伴参与,其中8家使用了多节点Blackwell NVL72系统,包括华硕、Azure、思科、CoreWeave、Crusoe、戴尔科技、富士通、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、广达云技术、Red Hat、ScitiX、Supermicro和Wiwynn。