xAI的Colossus集群拥有55万块GPU,但模型浮点运算利用率仅约11%,远低于行业35%至45%的水平。为此,xAI放弃JAX和PyTorch,改用C++和CUDA重写训练栈,并大量使用内联PTX直接控制GPU以逼近裸金属性能。Grok 4.8参数达2.5万亿,训练成本极高。更关键的是,xAI正让较弱模型参与编写训练更强模型的代码,形成递归自我改进循环,但AI生成代码的正确性验证仍是巨大风险。
完成下面两步后,将自动完成登录并继续当前操作。