内容提要
OpenAI发布自研推理芯片Jalapeño的首批性能数据,显示其能效和延迟优于现有加速器。该芯片专为AI代理设计,减少数据移动等待,在GPT-OSS等模型上吞吐量提升1.5至1.9倍,延迟降低1.7至3.6倍。OpenAI计划年底部署,并已研发下一代芯片。
延伸解读
能效与延迟的平衡
Jalapeño芯片的设计重点并非单纯提升吞吐量,而是在不牺牲响应时间的前提下提高能效。传统推理加速器往往通过增加批处理规模来提升效率,但这会导致单个用户的等待时间变长。OpenAI的测试显示,Jalapeño在吞吐量提升1.5至1.9倍的同时,延迟降低了1.7至3.6倍,表明其试图同时优化计算和内存带宽,减少数据移动带来的等待,这对需要多步骤顺序执行的AI代理尤为重要。
AI辅助芯片优化
OpenAI在Jalapeño的开发中引入了AI辅助设计,利用AI生成的代码实现部分模型模块,运行速度比人类专家编写的版本快1.5至1.8倍。这得益于芯片设计采用本地张量、显式通信和可预测同步,使AI能够参与任务映射和调度。尽管每个新模型仍需定制内核,但AI辅助优化有望加快芯片对新模型的适配速度,并可能扩展Codex在硬件设计领域的应用。
部署计划与生态影响
Jalapeño计划于今年年底部署到OpenAI自身基础设施中,同时下一代芯片已在研发中。OpenAI表示将继续使用Nvidia等合作伙伴的加速器,但自研芯片使其能更自主地协调硬件与模型演进。这一举措可能对现有AI芯片市场格局产生影响,但文章未提及具体成本或性能对比细节,读者需关注后续实际部署效果。
Q&A
OpenAI自研的推理芯片Jalapeño在性能上有什么优势?
根据OpenAI发布的数据,Jalapeño在能效和延迟方面优于现有加速器。在GPT-OSS 120B、DeepSeek R1和Kimi K2.5等模型上,每瓦特处理的工作量提高了1.5至1.9倍,端到端延迟降低了1.7至3.6倍。在高度交互的工作负载上,速度比对比系统快2.1至4.1倍。
Jalapeño芯片的设计初衷是什么?
Jalapeño专为AI代理设计,旨在减少数据移动带来的等待时间,因为代理需要顺序执行多个步骤,延迟会累积。它通过保持模型状态(如KV缓存)本地化,并利用网络让更多工作负载留在同一连接系统内,从而减少数据移动,同时兼顾计算和内存带宽需求。
OpenAI是如何在九个月内完成Jalapeño芯片的设计到流片的?
OpenAI在开发过程中使用了自己的模型,通过探索实现方案并缩短设计、测量和验证周期,从而在九个月内从初始设计到流片。
AI在Jalapeño芯片的编程和优化中扮演了什么角色?
OpenAI使用AI生成的实现(基于Codex和GPT-Astra等模型)来优化芯片上的注意力机制和混合专家模块,这些AI生成的实现比专家手写的版本快1.5至1.8倍。此外,AI还帮助将三个开源模型在两个月内优化到高性能,展示了AI在芯片编程和优化中的潜力。
Jalapeño芯片的功耗表现如何?
Jalapeño的额定功率为700瓦,但在测试中从未超过550瓦。能效比较基于各加速器的公布功率,Jalapeño在每瓦特性能上显著优于对比系统。
OpenAI计划何时部署Jalapeño芯片?
OpenAI计划在年底前将Jalapeño部署到自己的基础设施中,并且已经在研发下一代芯片。同时,OpenAI将继续使用Nvidia和其他合作伙伴的加速器。