内容提要
AMD收购Taalas公司,其技术将AI模型直接固化在芯片上,推理速度比英伟达快48倍,每秒生成近1.7万token。但模型无法更换,需重新流片,成本高昂。该技术主要面向模型固定、流量大的头部厂商,如OpenAI等,可大幅降低推理成本,但小公司难以承受,通用与专用芯片路线将分化。
延伸解读
速度与绑定:专用芯片的取舍
Taalas的MSIC技术将模型权重固化在芯片逻辑电路中,推理速度可达每秒近1.7万token,比英伟达GPU快48倍。但代价是模型无法更换,任何大改都需重新流片,成本高达数百万美元,耗时数月。这种设计适合模型固定、流量大的头部厂商,如OpenAI,可大幅降低推理成本;但对小公司而言,迭代频繁,绑定风险高,可能得不偿失。
部署模式与成本优势
AMD收购Taalas后,可能将其芯片与Instinct加速器搭配,用于提示词处理和生成分离,或先在GPU上验证模型再迁移至专用芯片。Taalas称,将权重刻入硅片的成本比训练大模型便宜100倍,这对每年烧数十亿美元算力的头部厂商极具吸引力。此外,低成本token可能推动“测试时缩放”技术,让模型思考更久,提升准确率,改变AI应用的成本结构。
安全与开源模型的适配性
网友担忧模型权重固化在芯片上可能被逆向工程,但反驳指出大模型权重达TB级,芯片存不下,Taalas仅固化计算核,权重仍从外部读取。同时,中国开源模型如DeepSeek、Qwen架构透明,迭代路径清晰,更适合这种“刻入硅片”的模式,而美国闭源模型技术细节不公开,预判稳定性更难。
Q&A
AMD收购Taalas公司的核心技术是什么?
AMD收购的Taalas公司开发了一种名为MSIC(模型专用集成电路)的技术,将AI模型权重直接固化在芯片的逻辑电路中,而不是存储在内存中,从而实现极快的推理速度。
Taalas芯片的推理速度有多快?相比英伟达GPU快多少?
Taalas的第一代测试芯片HC1在运行Llama 3.1 8B模型时,生成速度达到每秒16960个token,比英伟达GPU快48倍,比Cerebras快8.5倍。
Taalas芯片的主要缺点是什么?
主要缺点是模型被固化在芯片上,无法更换或升级,任何超过LoRA适配器级别的改动都需要重新流片,成本高达几百万美元,耗时数月,导致用户被特定模型绑定。
哪些类型的公司适合使用Taalas的芯片?
适合模型固定、流量巨大、对推理成本极度敏感的大规模服务商,如OpenAI、Anthropic、Meta等头部模型开发商,它们能承受流片成本并从中获得推理成本的大幅下降。
Taalas芯片如何与AMD的Instinct加速器配合使用?
有两种部署方式:一是将提示词处理放在GPU上,生成token的任务交给Taalas芯片;二是先在Instinct上验证和调试模型,确定最终版本后再迁移到Taalas专用芯片上运行。
Taalas技术可能如何影响AI模型开发?
由于推理成本大幅降低和速度提升,开发者可以更广泛地使用“测试时缩放”技术,让模型在回答前思考更久,从而提升准确率,改变AI应用开发的成本结构。
网友对Taalas技术有哪些主要争议?
争议包括:模型权重固化在芯片上是否安全,能否被逆向工程;SOTA模型迭代快,流片固化风险高;以及AMD收购是否会导致技术被雪藏等。
为什么中国开源模型可能更适合Taalas的制造模式?
因为中国开源模型如DeepSeek、Qwen透明度高,架构迭代路径清晰,便于预判稳定性,更适合将模型固化到芯片中。