内容提要
OpenAI完成10万亿参数预训练模型Bel,作为GPT-6底座,并推出自研芯片Jalapeño,功耗700瓦,性能超越英伟达旗舰。芯片用AI设计,9个月流片,软件栈不依赖CUDA。OpenAI借此降低推理成本,形成AI加速研发闭环,但大规模部署需至2027年,期间仍依赖英伟达,面临算力、资金和时间挑战。
延伸解读
预训练底座的意义
Bel作为10万亿参数的预训练底座,其价值在于后续模型都从它“长”出来。这意味着一旦拥有底座,后续开发成本大幅降低,而竞争对手若无法造出同等底座,差距将持续扩大。文章强调,预训练只是起点,真正的竞争在于能否持续迭代出GPT-6等后续模型。
自研芯片的挑战与时间差
Jalapeño芯片虽性能优异,但大规模部署需等到2027年,在此之前OpenAI仍依赖英伟达。这形成时间差,Anthropic可能利用IPO融资采购算力追赶。芯片的B0步进虽已量产,但若出现问题,计划将推迟,显示自研芯片的不确定性。
AI加速研发的闭环
OpenAI用AI设计芯片、写内核代码,形成“用AI加速AI研发”的闭环。Jalapeño从设计到流片仅9个月,内核由Codex生成,这挑战了传统芯片厂商的软件生态护城河。若闭环持续运转,其他公司可能难以追赶,行业格局或将被改写。
Q&A
OpenAI的Bel模型是什么?
Bel是OpenAI完成的一个预训练模型,参数超过10万亿,将作为GPT-6的底座,甚至可能成为世界上第一个达到AGI阈值级别的基座模型。
OpenAI自研芯片Jalapeño的性能如何?
Jalapeño是OpenAI自研的AI推理芯片,功耗仅700瓦,但每千瓦吞吐量比Nvidia旗舰产品高1.5到1.9倍,端到端延迟降低1.7到3.6倍,在高度交互工作负载下性能提升2.1到4.1倍。
OpenAI是如何在9个月内完成芯片流片的?
OpenAI使用AI辅助芯片设计,其模型参与了芯片设计、验证和优化,减少了SIMD面积8%和矩阵引擎面积10%。同时,内部版Codex用于编写芯片内核代码,加速了开发流程。
Jalapeño芯片的软件栈有什么特点?
Jalapeño的软件栈不依赖Nvidia的CUDA,而是使用自研的Gluon编程语言,基于Triton构建,暴露底层接口,并支持形式化验证的布局转换。内核采用持久化线程模式,由程序员控制任务分配。
为什么OpenAI选择不采用预填充-解码分离架构?
OpenAI认为预填充-解码分离会导致资源浪费,因为实际负载变化时,预填充池和解码池可能闲置。他们采用统一池架构,让每颗芯片都能处理任意计算,并通过优化内存子系统和片上网络来提升效率。
OpenAI的Jalapeño芯片何时大规模部署?
Jalapeño在2026年底只能非常小规模部署,大规模部署要等到2027年。在此之前,OpenAI仍需依赖Nvidia的GPU。
OpenAI自研芯片对AI行业有什么影响?
Jalapeño芯片降低了OpenAI的推理成本,并形成了用AI设计芯片、再用芯片加速AI的闭环。这可能改变AI行业的成本结构和竞争格局,削弱Nvidia的CUDA生态护城河。
Anthropic的IPO计划是什么?
Anthropic计划在2026年内进行IPO,目标估值2万亿美元,募资规模可能超过1000亿美元,这将打破SpaceX的IPO纪录。但投资者质疑其算力获取能力。