RSI榨干55万卡算力:xAI用C++栈造2.5万亿Grok 4.8

RSI榨干55万卡算力:xAI用C++栈造2.5万亿Grok 4.8

💡 原文中文,约3800字,阅读约需10分钟。
📝

内容提要

xAI的Colossus集群拥有55万块GPU,但模型浮点运算利用率仅约11%,远低于行业35%至45%的水平。为此,xAI放弃JAX和PyTorch,改用C++和CUDA重写训练栈,并大量使用内联PTX直接控制GPU以逼近裸金属性能。Grok 4.8参数达2.5万亿,训练成本极高。更关键的是,xAI正让较弱模型参与编写训练更强模型的代码,形成递归自我改进循环,但AI生成代码的正确性验证仍是巨大风险。

🔎

延伸解读

效率危机:55万GPU为何仅11%在干活

xAI的Colossus集群拥有55万块GPU,但模型浮点运算利用率(MFU)长期仅约11%,远低于行业35%至45%的正常水平。这意味着大量GPU在等待数据搬运、跨卡通信同步,以及编译器抽象层带来的额外开销。问题不在硬件数量,而在软件堆栈、并行策略和模型工程优化未能跟上硬件扩张速度。HBM读取慢、网络瓶颈被数万卡放大、显存压力与张量并行通信开销共同拖累了效率。

C++重写训练栈:绕过抽象层的代价与门槛

xAI放弃JAX和PyTorch,改用C++和CUDA重写训练栈,并大量使用内联PTX直接控制GPU。这样做能绕过Python解释器和框架抽象,逼近裸金属性能,例如手写内联PTX的快速平方根指令比编译器自动生成版本快38%。但代价是开发者必须同时精通GPU微架构和编译器内部原理,能胜任的人全球可能仅数千人,团队成本极高。

递归自我改进:弱模型写强模型代码的飞轮与风险

xAI正让较弱模型参与编写训练更强模型的代码,形成递归自我改进循环。底层训练栈的优化任务有明确对错标准,性能跑分就是铁证,模型可在封闭系统内反复试错。但风险在于:AI生成的PTX代码若存在微妙bug,可能在训练数月后才暴露,导致2.5万亿参数模型从头再来,代价高达数亿美元。人类工程师写错代码可通过Code Review发现,而AI写的一百万行PTX汇编中,一条错误指令极难定位。

2.5万亿参数的物理极限与效率生死线

Grok 4.8参数达2.5万亿,FP16精度下仅权重就需约5TB显存,8比特量化约2.5TB,4比特量化仍需约1.25TB,消费级硬件无法承载。这要求多节点集群,每层计算跨机器通信,参数越大通信开销越大,MFU越易下降。因此xAI必须用C++栈精确调度每块GPU和数据通路。MFU每提升一个百分点,可能意味着数百万美元电费和折旧的差别,11%到50%的提升空间直接关系到项目生死。

Q&A

xAI的Colossus集群GPU利用率为什么只有11%?

xAI的Colossus集群拥有约55万块GPU,但模型浮点运算利用率(MFU)长期只有约11%,远低于行业35%到45%的正常水平。主要原因是软件堆栈、并行策略和模型工程优化跟不上硬件扩张速度,导致GPU大量时间在等待数据搬运、跨GPU通信同步以及编译器生成的抽象层代码执行。

xAI为什么放弃JAX和PyTorch,改用C++重写训练栈?

xAI之前使用JAX训练Grok模型,但JAX的XLA中间层为Google TPU优化,在英伟达GPU上多了一层翻译,导致性能不佳。2026年6月底,马斯克宣布用C和C++重写训练和推理软件栈,因为C++没有Python解释器开销和框架抽象,编译代码更接近裸金属性能,并能通过内联PTX直接控制GPU,绕过中间层以提升效率。

什么是内联PTX,它如何提升GPU性能?

内联PTX是英伟达的一种虚拟指令集,相当于GPU的汇编语言。正常流程是Python→CUDA C→PTX→SASS机器码,每层翻译都有信息损耗。内联PTX允许跳过CUDA C,直接在代码中嵌入PTX指令,从而更精确地控制GPU。实测显示,编译器自动生成的快速平方根指令比手写内联PTX版本慢38%。

Grok 4.8的2.5万亿参数带来哪些挑战?

Grok 4.8参数达2.5万亿,以FP16精度计算,模型权重就需要约5TB显存,8比特量化约2.5TB,4比特量化约1.25TB。这还不包括KV缓存、优化器状态和激活值。因此必须运行在多节点集群上,跨机器通信开销大,MFU容易下降。训练和推理成本指数级增长,任何微小的效率损失都会被放大成巨大浪费。

xAI的递归自我改进循环是什么?

递归自我改进循环是指用较弱的模型(如Grok 4.5或4.6)参与编写训练更强模型(如Grok 4.8)的代码,然后Grok 4.8再用于编写下一代模型的训练代码。这个循环能加速模型迭代,因为底层训练栈的编写有明确的对错标准(如性能跑分),模型可以在封闭系统中反复试错优化。

AI生成训练代码存在哪些风险?

主要风险是正确性验证困难。如果AI生成的代码有微妙bug,可能在训练数月后才暴露,导致2.5万亿参数模型从头再来,代价高达数亿美元。人类工程师可以通过Code Review发现问题,但AI生成的一百万行PTX汇编中很难找到错误指令。此外,AI可能生成“看起来对、跑起来快、但结果有微妙偏差”的代码,性能跑分无法检测数值误差,可能导致训练发散。

🏷️

标签

➡️

继续阅读