智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

智谱发布并开源GLM-5.3-Flash多模态模型,性能超GLM-5.2,与Claude Opus 4.8持平。商汤大装置提供国产算力支持,通过异构混推技术提升服务性能3倍,成本与英伟达GPU相当,推动国产算力规模化商用,日均Token服务量达2.42万亿。

🔎

延伸解读

国产算力规模化商用的关键突破

文章指出,GLM-5.3-Flash在正式发布前,其匿名版本在OpenCode和OpenRouter上的Token调用量高达62T,且全部由国产芯片提供算力支持。这标志着国产算力已从“单点可用”走向“大规模商用”,能够在大规模真实业务场景下高效、经济地支撑前沿大模型推理需求,打破了市场对国产算力性价比不高、难以规模商用的固有认知。

异构混推技术如何提升性价比

商汤大装置通过异构混合推理技术,根据不同推理阶段对计算和带宽的需求,让不同架构、不同定位的国产芯片协同工作,整体推理性价比达到NVIDIA H系列的1.25倍,相比国产同构推理,同等成本下Token产能扩大约2.5倍。这一技术路径跳出了单卡性能比拼的传统思路,为国产算力提升竞争力提供了新方向。

Token工厂模式与未来增长预期

商汤大装置通过“Token工厂”整合多元算力,优化推理引擎与芯片性能,形成大规模、高效率、低成本的Token供给能力。文章提到,7月日均Token服务量已达2.42万亿,预计2026年年底突破日均10万亿,全年Token量级增长25倍。这一增长预期反映了国产算力在支撑大模型服务方面的巨大潜力。

Q&A

GLM-5.3-Flash是什么时候发布的?

GLM-5.3-Flash于8月26日晚正式上线并开源。

GLM-5.3-Flash在AA综合智能指数中得了多少分?

GLM-5.3-Flash在AA综合智能指数中取得57分,与Claude Opus 4.8持平。

GLM-5.3-Flash的架构和参数规模是怎样的?

GLM-5.3-Flash是GLM-5系列的首个原生多模态模型,总参数320B(320B-A18B),架构专为极低成本设计,结合30T Token多模态预训练语料。

商汤大装置为GLM-5.3-Flash提供了哪些支持?

商汤大装置通过国产异构混推技术为GLM-5.3-Flash提供大规模国产算力支持与Token服务,提升了服务性能。

GLM-5.3-Flash在正式发布前进行了哪些测试?

GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行了大规模测试,Token调用量高达62T,全部由国产芯片提供算力支持。

国产算力在支持GLM-5.3-Flash时性能提升多少?

相较同一硬件环境下的初始基线,GLM-5.3-Flash基于国产芯片集群,端到端服务性能提升3倍,硬件效率和单Token成本已达到主流英伟达GPU相当水平。

商汤大装置在性价比方面有哪些优势?

商汤大装置通过异构混合推理技术,整体推理性价比达到NVIDIA H系列的1.25倍,同等成本下Token产能扩大约2.5倍。

商汤大装置在适配性和能效比方面做了哪些工作?

在适配性上,通过底层算子优化、多卡并行调优和工具链适配降低国产算力应用门槛;在能效比上,推出算电协同Agent,并重新定义TPW(Tokens Per Watt)作为AIDC价值标尺。

商汤大装置Token Factory的日均Token服务量是多少?

7月日均Token服务量已达到2.42万亿,预计2026年年底突破日均10万亿,全年Token量级增长25倍。

🏷️

标签

➡️

继续阅读