神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡

神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

智谱发布并开源GLM-5.3 Flash模型,即此前海外爆火的神秘模型“牛来”。该模型为320B参数、原生多模态,能力超越更大体量模型,在AA榜单获57分,价格仅为Claude Opus 4.8的1/40。实测中能精准配字幕、制作电影解说和还原设计稿。其采用混合注意力架构,运行于国产芯片,支持1M上下文,并已全面开源。

🔎

延伸解读

「牛来」爆火背后的匿名测试现象

「牛来」在海外匿名测试期间,凭借实际表现冲上OpenRouter和OpenCode双平台榜首,甚至终结了DeepSeek在OpenCode连续56天的霸榜纪录。这一现象说明,在模型能力足够强时,用户会自发用脚投票,品牌和来源并非首要考量。对开发者而言,匿名测试也提供了一个更纯粹评估模型实力的窗口。

混合注意力架构如何实现高效长上下文

GLM-5.3 Flash采用线性注意力与稀疏注意力混合架构,通过轻量级索引器(IndexPool)压缩缓存向量,使注意力计算量降低3.01倍,KV Cache缩小4.44倍。这种设计让320B参数的模型在1M超长上下文下仍能高效运行,避免了全量注意力计算的高昂成本,是其在长任务中保持性能的关键。

国产芯片支撑全球流量,成本优势显著

GLM-5.3 Flash的线上请求全部由国产芯片提供算力,通过Encode-Prefill-Decode分离式架构和底层优化,端到端服务性能提升3倍,单Token成本与主流英伟达GPU相当。这打破了前沿模型依赖高端进口芯片的惯例,为国产算力在AI推理领域的规模化应用提供了实证。

开源与低成本,推动Agent应用普及

GLM-5.3 Flash在AA榜单得分与Claude Opus 4.8持平,但价格仅为后者的1/40,且已全面开源。这种「高性能+低成本+可部署」的组合,降低了Agent等长时任务的使用门槛,使前沿模型更接近「日常消耗品」,有望加速AI在复杂工作流中的落地。

Q&A

神秘模型「牛来」的真实身份是什么?

神秘模型「牛来」(Ox Alpha)是智谱发布的GLM-5.3 Flash模型,该模型已开源,是GLM-5系列中首个原生多模态模型。

GLM-5.3 Flash在能力上相比GLM-5.2有什么提升?

GLM-5.3 Flash参数为320B,全面超越了体量为753B的GLM-5.2,在AA榜单上获得57分,与Claude Opus 4.8持平。

GLM-5.3 Flash的定价如何?

GLM-5.3 Flash的定价是GLM-5.3的1/10,限时折扣为1/20,仅为Claude Opus 4.8的1/40,且定价低于DS-V4-Flash。

GLM-5.3 Flash在架构上有什么创新?

GLM-5.3 Flash采用线性注意力+稀疏注意力的混合架构,并引入IndexPool将索引器缓存向量从4个压缩到1个,相比GLM-5.3,注意力计算量降低3.01倍,KV Cache缩小4.44倍。

GLM-5.3 Flash如何支持国产芯片?

智谱将多模态编码、Prompt预填充和逐Token解码拆分为Encode-Prefill-Decode分离式架构,并叠加Layer Split、混合缓存量化等优化,使模型能在国产加速芯片上高效运行,端到端服务性能提升3倍,单Token成本与主流英伟达GPU相当。

GLM-5.3 Flash在实测中展示了哪些能力?

实测中,GLM-5.3 Flash能精准识别视频中的说话人并配字幕,能根据完整电影生成解说视频,还能根据UI设计稿生成可交互的购物App,以及独立完成3D场景构建等复杂任务。

GLM-5.3 Flash是否开源?

是的,GLM-5.3 Flash已全面开源,并接入ZCode、开放API,开发者可以获取权重并自行部署。

🏷️

标签

➡️

继续阅读