谷歌押注推理未来:为单一模型打造的定制芯片

谷歌押注推理未来:为单一模型打造的定制芯片

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

谷歌正研发代号“Frozen v2”的定制芯片,将Gemini模型架构部分硬编码于硅片,同时保留权重可更新,以提升推理效率。目标每瓦特令牌数提升6至10倍,缓解算力压力并降低成本。此举反映AI推理正从通用GPU转向模型专用硬件,类似比特币挖矿的ASIC演进,但保留灵活性以适配模型迭代。

🔎

延伸解读

硬编码架构与可更新权重的平衡

Frozen v2 的独特之处在于它并非将整个模型固化在芯片上,而是只硬编码部分架构,同时保留权重可更新。这种设计既获得了专用芯片的效率,又避免了硬件因模型迭代而过时。此前 Jeff Dean 曾提出将权重直接嵌入硅片,但因灵活性不足被放弃。Frozen v2 的折中方案可能成为未来模型专用芯片的参考范式。

推理效率提升的潜在影响

若实现每瓦特令牌数提升6至10倍,将显著降低 Gemini 的推理成本。对开发者而言,这可能意味着更低的 API 价格或更高的可用容量。不过,谷歌尚未明确如何将节省的成本传递给用户。效率提升还可能缓解算力紧张,使云服务商能更好地应对需求增长。

行业趋势:从通用GPU到专用硬件

AI推理正从通用GPU转向模型专用硬件,类似比特币挖矿从CPU到ASIC的演进。除谷歌外,Taalas 将 Llama 模型嵌入芯片,d-Matrix 和 SambaNova 也各有优化。Nvidia 与 Groq 的20亿美元交易也表明行业对推理效率的重视。这一趋势可能重塑AI基础设施的格局。

Q&A

谷歌的Frozen v2芯片是什么?

Frozen v2是谷歌正在研发的一款定制芯片,它将Gemini模型的部分架构硬编码在硅片上,同时保留模型权重可更新,以提升推理效率。

Frozen v2芯片如何平衡效率与灵活性?

Frozen v2通过将Gemini模型的部分架构硬编码在芯片上,但保留权重可更新,从而在获得模型专用硬件的高效率的同时,避免因模型更新而需要更换硬件。

谷歌研发Frozen v2芯片的目标是什么?

谷歌的目标是缓解AI算力紧张,降低Gemini模型的推理成本,并提高效率,预计每瓦特令牌数可提升6至10倍。

Frozen v2与之前的概念(如Jeff Dean提出的方案)有何不同?

之前的概念会将Gemini的模型权重直接嵌入芯片,导致硬件只能用于单一版本,寿命有限。Frozen v2则只硬编码部分架构,权重可更新,因此能适应模型迭代。

Frozen v2芯片对开发者意味着什么?

它预示着未来AI系统将更紧密地集成模型与硬件,可能带来更低的API成本和更高的可用容量,但开发者可能需要适应这种专用硬件的限制。

除了谷歌,还有哪些公司在探索AI推理专用硬件?

英伟达投资了Groq,Taalas将整个模型嵌入芯片,d-Matrix采用SRAM存内计算,SambaNova使用自定义数据流技术。

Frozen v2芯片如何降低推理延迟?

通过将部分模型执行硬编码在芯片上,减少通用硬件上的开销,从而降低延迟,尤其有利于需要近实时响应的应用。

🏷️

标签

➡️

继续阅读