AI 开始给自己造芯了,OpenAI 只用了九个月

AI 开始给自己造芯了,OpenAI 只用了九个月

💡 原文中文,约4500字,阅读约需11分钟。
📝

内容提要

OpenAI与博通联合自研AI推理芯片Jalapeño,测试显示其能效比英伟达GB200/GB300高1.5-1.9倍,延迟大幅降低。该芯片专为推理优化,配备216GiB HBM4,功耗仅约550W。项目从设计到流片仅9个月,AI参与开发加速进程。OpenAI计划年底部署,并推动自研芯片趋势,以降低成本、掌控算力供给。

🔎

延伸解读

能效比背后的成本账

Jalapeño 的能效比优势直接转化为成本优势。文章指出,其实际功耗低于 550W,而英伟达 GB200 和 GB300 标称功耗分别为 1200W 和 1400W。对于数据中心而言,能耗是运营成本的大头,能效提升意味着电费大幅下降。结合 ChatGPT 的巨大调用量,OpenAI 通过自研芯片节省的算力成本,有望覆盖研发投入,这是其自研芯片的核心经济驱动力。

推理专用芯片的针对性优化

Jalapeño 专为推理设计,针对大模型推理中的 Decode 阶段进行了优化。该阶段需要反复读取内存中的权重和 KV Cache,容易遭遇“内存墙”。Jalapeño 通过配备 216GiB HBM4 和 15.4TB/s 的高带宽,以及将计算核心与内存分区对应,减少数据搬运,从而显著降低延迟。这种设计思路与通用 GPU 不同,体现了专用芯片在特定负载下的性能优势。

AI 加速芯片研发的启示

Jalapeño 从设计到流片仅用 9 个月,远快于传统 18-24 个月的周期。关键因素在于 AI 的参与:OpenAI 使用模型辅助设计、验证和优化,并用 Codex 和 Astra 模型快速适配其他模型。这表明 AI 正在改变芯片研发的流程,缩短迭代周期。未来,随着 AI 工具更成熟,芯片设计速度可能进一步加快,这对整个半导体行业具有深远影响。

自研芯片的生态与风险

OpenAI 的策略是“以广度建生态,以自营握杠杆”:训练和通用计算继续采购外部芯片,推理则使用自研芯片。第一代 Jalapeño 不出售也不出租,产能全部自用。这种模式有助于 OpenAI 掌控算力供给,降低对单一供应商的依赖,但也面临风险:自研芯片的生态和软件栈需要时间成熟,且若性能或良率不及预期,可能影响部署计划。

Q&A

OpenAI自研的AI推理芯片Jalapeño相比英伟达GB200/GB300在能效和延迟方面表现如何?

根据SemiAnalysis的InferenceX基准测试,Jalapeño每瓦完成的AI工作比英伟达GB200/GB300多1.5-1.9倍,端到端延迟缩短至对照系统的约30%-60%。例如,运行DeepSeek R1时,一次8K输入、1K输出的推理从5.99秒降至1.65秒,最低token间隔从5.90ms降至1.43ms。

Jalapeño芯片的设计目标是什么?它如何针对AI推理进行优化?

Jalapeño从设计之初就专为现代大模型的推理部分优化,而非通用GPU。它通过将计算核心、HBM内存和网络通盘协同设计,减少数据搬运时间,并采用216GiB HBM4内存,带宽达15.4TB/s,接近微软Maia 200和Google Ironwood的两倍。此外,它将计算核心和HBM划分成多个对应区域,使模型权重和KV Cache尽量留在本地内存,减少跨区域同步,从而降低延迟。

Jalapeño芯片的功耗是多少?相比英伟达芯片有何优势?

Jalapeño的标称功耗为700W,实际测试中持续功耗低于550W,而英伟达GB200和GB300的标称功耗分别为1200W和1400W。这意味着Jalapeño能用约一半的能耗实现更高的推理性能,有助于降低数据中心的算力成本。

OpenAI从设计到流片Jalapeño芯片用了多长时间?通常需要多久?

Jalapeño从初始设计到流片只花了9个月,而根据Semiconductor Engineering的估算,类似复杂度的AI加速芯片通常需要18-24个月。OpenAI将设计周期压缩了近一半,这得益于AI参与开发,包括探索实现方案、验证和修改方案、优化算术电路等。

OpenAI计划何时部署Jalapeño芯片?第二代和第三代产品进展如何?

OpenAI计划在年底前将Jalapeño部署到计算基础设施中。同时,第二代产品已经在开发中段,第三代也初具雏形。

为什么OpenAI等大模型公司纷纷自研芯片?

主要原因有两个:一是算力效率关乎经济账,自研芯片能降低推理成本,例如GPT-4o到GPT-5.6 Luna的API价格降幅超过94%,自研芯片有助于进一步节省开支;二是算力供给的掌控,避免受制于单一供应商的产能和报价,确保模型研发的稳定性。

Jalapeño芯片的推出对ChatGPT的用户体验可能带来什么影响?

Jalapeño的推理速度提升可能使ChatGPT的响应更快,未来可能推出3倍速输出的模式。同时,由于Agent任务需要连续调用模型,推理延迟的降低将使Agent的响应更接近普通聊天,可能让ChatGPT首页不再需要区分“聊天”和“工作”,恢复为单一对话框。

除了OpenAI,还有哪些公司在自研AI芯片?

Google有TPU系列,最新第八代分为训练用TPU 8t和推理用TPU 8i,并正在研究代号Frozen v2的服务器芯片;亚马逊AWS开发了Inferentia和Trainium芯片,Anthropic通过Project Rainier获得近100万颗Trainium芯片算力,并正在组建内部芯片团队;OpenAI的Jalapeño是其中之一。

🏷️

标签

➡️

继续阅读