内容提要
OpenAI自研推理芯片“小辣椒”跑分超越英伟达Blackwell,能效和时延优势显著,但训练仍依赖英伟达。芯片由AI辅助设计,量产计划2027年启动。同时,OpenAI数据中心负责人离职,高管变动频繁,引发外界关注。
延伸解读
跑分优势的适用边界
SemiAnalysis的实测显示,小辣椒在单token预测(STP)下能效和时延优势显著,但对比的Blackwell成绩开启了多token预测(MTP)。若与同样开启MTP的GB300对比,峰值能效优势缩至约1.5倍。此外,跑分未覆盖长上下文多轮对话的AgentX负载,因此实际生产环境中的表现可能有所不同。
对标下一代芯片更合理
SemiAnalysis指出,拿Blackwell对比并不公平,小辣椒真正要对标的是采用HBM4的下一代Vera Rubin。Rubin系统已开始出货,而小辣椒仍是工程样品。即便如此,小辣椒的单token预测每兆瓦吞吐已超过Rubin的多token预测成绩,且未使用推测解码,若补上该技术,成本优势将进一步扩大。
AI辅助设计的双刃剑
小辣椒的快速迭代得益于AI辅助设计:Codex等工具帮助缩减SIMD单元和矩阵引擎面积,部分AI内核性能优于人类专家。然而,讽刺的是,OpenAI跑在英伟达GPU上的模型参与了设计这颗威胁CUDA生态的芯片。这凸显了AI自进化的潜力,但也引发对依赖AI设计可靠性的思考。
高管离职与量产前景
数据中心负责人Chris Malone离职,成为4月以来第7位离任或换岗的高管。Stargate项目开局不顺,OpenAI转向租用云厂商芯片,近期恢复自建但带队者并非Malone。量产计划2027年启动,但领导层频繁变动可能影响执行,小辣椒的落地前景存在不确定性。
Q&A
OpenAI自研芯片“小辣椒”在哪些方面超越了英伟达Blackwell?
根据SemiAnalysis的实测,OpenAI自研芯片“小辣椒”在能效和推理时延上显著优于英伟达Blackwell:每千瓦推理吞吐是GB200/GB300机架系统的1.5到1.9倍,端到端推理时延低1.7到3.6倍,超低时延场景快2.1到4.1倍。
OpenAI自研芯片“小辣椒”的量产时间是什么时候?
“小辣椒”的量产计划在2027年逐步爬坡,大部分产出集中在2027年底,下一阶段目标是100MW规模。
OpenAI自研芯片“小辣椒”的功耗和内存配置如何?
“小辣椒”的热设计功耗(TDP)为700W,内存采用六组HBM4,单封装容量216GB,带宽15.4TB/s,是目前已出货或接近出货的加速卡中最高的。
OpenAI自研芯片“小辣椒”在开发过程中使用了哪些AI工具?
开发过程中使用了Codex和GPT-Astra辅助设计,AI编写了部分内核,其中部分AI内核比人类专家内核快1.5到1.8倍。
OpenAI自研芯片“小辣椒”发布后,英伟达股价为何不跌反涨?
英伟达股价上涨2.19%,原因包括:英伟达发布了新产品Jetson Orin Nano 2机器人电脑;OpenAI明确表示不会弃用英伟达,训练仍大量使用英伟达芯片,且双方有融资担保的合作。
OpenAI数据中心负责人Chris Malone为何离职?
Chris Malone于上周离职,没有继任者,职责拆分为多位负责人。他于2025年3月加入OpenAI,负责数据中心建设。离职原因未明确,但OpenAI近期高管变动频繁,已有4位高管离职。