内容提要
英伟达AI工厂每兆瓦建造成本约6000万美元,投资回报取决于产能、寿命和需求。其平台具备高产、耐用、通用三大特性:每兆瓦吞吐量最高、每token成本最低;GPU多年后仍可创收;可运行各类AI及非AI负载。全栈协同设计与CUDA软件持续优化,使旧硬件不闲置,从而最大化回报。
延伸解读
投资回报的三大支柱
文章指出,AI工厂每兆瓦建造成本约6000万美元,投资回报取决于三个相互关联的因素:产能(每兆瓦可产出的token收入)、使用寿命(硬件持续创收的时间)和需求(token的市场需求)。三者不能相互完全弥补,例如高产能若只卖出部分则回报有限,高需求若硬件很快停摆也无意义。因此,最大化回报需要同时提升这三个维度。
旧硬件为何不闲置
尽管新一代GPU性能大幅提升,旧硬件仍能持续创收。文章举例:2020年发布的A100 GPU六年后仍在商用,CoreWeave将2020年首次推出的单元预订延长至2029年;微软的V100 fleet实际运行8.4年,超过六年账面寿命。CUDA软件跨代兼容,持续优化使旧硬件不 stranded,且不同工作负载对硬件需求不同,旧代产品仍有适用场景。
通用性如何扩大需求
AI工厂若只能运行单一类型工作负载,则面临工作变化的风险。英伟达平台可运行所有类型的AI模型(开源与专有)、所有阶段(数据处理、预训练、后训练、推理)和所有场所(超大规模、AI云、主权项目、企业、边缘),还能运行非AI负载如科学计算、模拟、图形等。这种通用性提高了利用率,并因能承接更多种类工作而延长了创收周期。
效率提升反而刺激需求
文章提出一个关键问题:如果每代GPU都大幅降低token成本,算力需求会萎缩吗?答案是否定的。更便宜的token使更多用例变得经济可行,而这些新用例消耗的token总量超过效率节省的部分,从而推动需求扩张。这意味着AI工厂的产能提升不会导致收入下降,反而可能因需求增长而受益。
Q&A
英伟达AI工厂每兆瓦的建造成本是多少?
每兆瓦AI工厂的建造成本约为6000万美元。
影响AI工厂投资回报的三个关键因素是什么?
三个关键因素是: earning capacity(产能收益)、useful life(使用寿命)和demand(需求)。
英伟达AI工厂的三大特性是什么?
三大特性是:高产(Productive)、耐用(Durable)和通用(Fungible)。
英伟达如何实现高产?
通过全栈协同设计,实现每兆瓦最高吞吐量和每token最低成本,从而最大化产能收益。
为什么英伟达GPU在多年后仍能创收?
因为CUDA软件平台跨代兼容,持续优化使旧硬件不闲置,且并非所有工作负载都需要最新系统,因此旧GPU仍可服务多年。
英伟达AI工厂的通用性体现在哪些方面?
可运行所有类型的AI模型(开源和专有),覆盖语言、视觉、生物、物理和机器人等领域;支持从数据处理到预训练、后训练和推理的各个阶段;部署在超大规模、AI云、主权项目、企业数据中心和边缘等各个场所;还能运行非AI工作负载如数据处理、科学计算、模拟和图形。
CUDA-X库在AI工厂中起什么作用?
CUDA-X库提供超过1000个现成库,覆盖深度神经网络、计算光刻、量子电路模拟、向量搜索和气候建模等,使工厂能运行任何加速工作负载。
有哪些客户案例展示了英伟达AI工厂的通用性?
例如:Lilly使用1016块GPU集群运行蛋白质、小分子和基因组模型;Pinterest在超大规模云上跨14000块GPU部署视觉语言模型;Revolut用cuDF处理数十亿交易记录并训练基础模型;Runway在Hopper上训练世界模型并在Blackwell上服务;德州农工大学在超级计算机上运行分子模拟和AI药物发现,利用率达95-98%。