内容提要
谷歌正研发代号“Frozen v2”的定制芯片,将Gemini模型架构部分硬编码于硅片,同时保留权重可更新,以提升推理效率。目标每瓦特令牌数提升6至10倍,缓解算力压力并降低成本。此举反映AI推理正从通用GPU转向模型专用硬件,类似比特币挖矿的ASIC演进,但保留灵活性以适配模型迭代。
延伸解读
硬编码架构与可更新权重的平衡
Frozen v2 的独特之处在于它并非将整个模型固化在芯片上,而是只硬编码部分架构,同时保留权重可更新。这种设计既获得了专用芯片的效率,又避免了硬件因模型迭代而过时。此前 Jeff Dean 曾提出将权重直接嵌入硅片,但因灵活性不足被放弃。Frozen v2 的折中方案可能成为未来模型专用芯片的参考范式。
推理效率提升的潜在影响
若实现每瓦特令牌数提升6至10倍,将显著降低 Gemini 的推理成本。对开发者而言,这可能意味着更低的 API 价格或更高的可用容量。不过,谷歌尚未明确如何将节省的成本传递给用户。效率提升还可能缓解算力紧张,使云服务商能更好地应对需求增长。
行业趋势:从通用GPU到专用硬件
AI推理正从通用GPU转向模型专用硬件,类似比特币挖矿从CPU到ASIC的演进。除谷歌外,Taalas 将 Llama 模型嵌入芯片,d-Matrix 和 SambaNova 也各有优化。Nvidia 与 Groq 的20亿美元交易也表明行业对推理效率的重视。这一趋势可能重塑AI基础设施的格局。
Q&A
谷歌的Frozen v2芯片是什么?
Frozen v2是谷歌正在研发的一款定制芯片,它将Gemini模型的部分架构硬编码在硅片上,同时保留模型权重可更新,以提升推理效率。
Frozen v2芯片如何平衡效率与灵活性?
Frozen v2通过将Gemini模型的部分架构硬编码在芯片上,但保留权重可更新,从而在获得模型专用硬件的高效率的同时,避免因模型更新而需要更换硬件。
谷歌研发Frozen v2芯片的目标是什么?
谷歌的目标是缓解AI算力紧张,降低Gemini模型的推理成本,并提高效率,预计每瓦特令牌数可提升6至10倍。
Frozen v2与之前的概念(如Jeff Dean提出的方案)有何不同?
之前的概念会将Gemini的模型权重直接嵌入芯片,导致硬件只能用于单一版本,寿命有限。Frozen v2则只硬编码部分架构,权重可更新,因此能适应模型迭代。
Frozen v2芯片对开发者意味着什么?
它预示着未来AI系统将更紧密地集成模型与硬件,可能带来更低的API成本和更高的可用容量,但开发者可能需要适应这种专用硬件的限制。
除了谷歌,还有哪些公司在探索AI推理专用硬件?
英伟达投资了Groq,Taalas将整个模型嵌入芯片,d-Matrix采用SRAM存内计算,SambaNova使用自定义数据流技术。
Frozen v2芯片如何降低推理延迟?
通过将部分模型执行硬编码在芯片上,减少通用硬件上的开销,从而降低延迟,尤其有利于需要近实时响应的应用。