内容提要
商汤大装置在WAIC展示国产算力成果,通过异构混合推理组合高端与国产芯片,算力利用率提升85%-152%,单位成本Token产出提升2.5倍。其端到端整合策略从硬件到电力协同,实现高毛利增长,并计划扩展至太空算力等领域。
延伸解读
异构混合推理:用系统优化弥合芯片代差
商汤大装置通过将Prefill和Decode阶段分离,把高带宽需求的Decode交给高端芯片,把高吞吐需求的Prefill交给国产芯片,实现了约1块高端芯片带动30块国产芯片的组合。这种系统层面的优化,使国产芯片的算力利用率(MFU)提升了85%-152%,单位成本的Token产出提升了2.5倍。这提示我们,在芯片性能存在代差的情况下,通过架构设计和调度优化,可以在实际应用中显著缩小差距。
端到端整合:从硬件到电力的全链条把控
商汤大装置选择自建机房、自购硬件、自研调度系统,并直接对接客户,形成了端到端的整合能力。这种模式减少了层间损耗,使得跨层优化成为可能。例如,他们推出的“算电协同Agent”将算力任务与电力调度联动,利用峰谷电价和储能设施,使单位电力成本的Token产出提升了约80%。这种全链条的把控,是其在国产芯片适配和成本控制上形成优势的关键。
供需失衡窗口期:高增长背后的市场机遇与挑战
商汤大装置的高毛利和高增长,部分得益于当前算力市场的供需失衡。Agent类应用兴起导致算力需求同比上涨5-10倍,而主流算力供给增长有限,大厂优先保障内部业务,溢出需求无人承接,商汤抓住了这一窗口期。但文章也指出,一旦供给端跟上,这轮红利可能收窄。因此,商汤沉淀的端到端整合方法论和跨场景复用能力,才是其长期竞争力的核心。
Q&A
商汤大装置如何实现国产芯片业务的正毛利?
商汤大装置通过异构混合推理技术,将高端芯片用于Decode阶段,国产芯片用于Prefill阶段,并进行了系统层面的优化,如算子重写、调度策略调整,从而提升了算力利用率和单位成本Token产出,实现了国产芯片业务的正毛利。
异构混合推理是什么?它如何提升算力利用率?
异构混合推理是将Prefill和Decode阶段分离,用高端芯片处理对带宽要求高的Decode阶段,用国产芯片处理对算力要求分散的Prefill阶段。通过这种分工,一块高端芯片可带动约30块国产芯片,使主流国产芯片的MFU提升85%-152%,单位成本Token产出提升2.5倍。
商汤大装置在系统层面做了哪些优化来适配国产芯片?
商汤大装置在系统层面进行了底层编译器适配、算子重写、上层框架对接和调度策略调整,并利用AI自动生成算子适配代码,以减少人工适配工作,跟上模型迭代速度。
商汤大装置的端到端整合策略是什么?为什么它能成功?
商汤大装置的端到端整合策略是自己建机房、采购硬件、开发调度系统并直接对接客户,将算力和电力联合调度。这种策略减少了层间损耗,实现了联合优化,是其成功的关键。
商汤大装置在电力方面采取了什么措施来降低成本?
商汤大装置发布了“算电协同Agent”,通过预测算力任务的耗电特征,与电力调度系统打通,结合峰谷电价和储能设施调节用电节奏,使单位电力成本的Token产出提升了约80%。
商汤大装置与哪些生态伙伴合作?合作内容是什么?
商汤大装置联合了近20家生态伙伴,包括寒武纪、沐曦股份、中科海光、华为昇腾等国产芯片厂商,以及曦智科技、硅基流动等基础设施厂商,共同发起国产AI基础设施生态共建计划,计划建设Token运营中心、万卡级国产智算集群,并赋能200家AI初创组织。
商汤大装置在太空算力方面有什么规划?
商汤大装置与国星宇航签约,共同探索太空算力合作,计划到2026年首发“商汤号”系列算力卫星并组网,到2030年建成天地一体化AI算力星座,用于应急救灾、远洋船舶等弱网络环境下的实时AI推理。
商汤大装置的高增长是否可持续?为什么?
商汤的高增长部分得益于当前供需失衡的市场窗口期,但供给端一旦追上来,红利可能收窄。不过,商汤沉淀的端到端整合方法论可跨场景复用,且模型应用场景持续增多,单一芯片难以满足所有需求,这为商汤留下了长期发展空间。