内容提要
智谱开源发布GLM-5.3-Flash模型,采用MoE架构,总参数320B但激活仅18B,提升响应速度并降低成本。该模型在编程和智能体能力上接近Claude Opus 4.8,支持1M上下文,引入混合注意力机制。此前以ox-alpha代号在OpenRouter测试,现以MIT许可证开放下载。
延伸解读
架构调整:更小激活参数带来效率提升
GLM-5.3-Flash采用MoE架构,总参数320B但激活仅18B,相比GLM-4.5系列(355B总参、32B激活)显著降低推理成本。层数从92层减至45层,并首次引入线性注意力与稀疏注意力混合架构,使注意力计算量降低约30%,KV Cache占用减少约25%。这些设计旨在提升响应速度并降低部署门槛,尤其适合高频调用场景。
编程与智能体能力:基准测试表现亮眼
在官方测试中,GLM-5.3-Flash在DeepSWE v1.1(63.4分 vs 46.2分)和AutomationBench(48.8 vs 26.2)上较前代大幅提升。Toolathlon Verified得分78.4,超过Claude Opus 4.8的76.2;Code Bench最高推理强度下29.0分,接近Claude Opus 4.8的29.5分。这表明其在真实编程任务和智能体工具调用方面具备竞争力。
成本优势:性能接近但成本大幅降低
根据Artificial Analysis Intelligence Index,GLM-5.3-Flash获得57分,折扣后单任务成本约0.045美元,而Z.ai称相同性能过去通常需要约10倍成本。这意味着开发者可以以更低价格获得接近顶级模型的性能,尤其适合对成本敏感的规模化应用。但需注意,成本数据基于特定测试环境,实际使用可能因场景而异。
开源许可与发布策略:匿名测试后正式开源
该模型此前以ox-alpha代号在OpenRouter和OpenCode上免费部署,收集真实用户反馈并迅速成为热门。现以MIT许可证开放权重下载,允许个人和商业使用,甚至可修改后重新发布。这种先匿名测试再开源的方式,有助于在正式发布前优化模型,同时为开发者提供了灵活的商用选择。
Q&A
GLM-5.3-Flash模型的总参数和激活参数分别是多少?
GLM-5.3-Flash采用MoE架构,总参数规模为320B,但每次推理时仅激活18B参数。
GLM-5.3-Flash在编程和智能体能力上与哪个模型接近?
GLM-5.3-Flash在编程和智能体能力上接近Claude Opus 4.8。
GLM-5.3-Flash的上下文长度是多少?它引入了什么新的注意力机制?
GLM-5.3-Flash支持1M上下文,并首次在GLM系列引入线性注意力与稀疏注意力组成的混合架构。
GLM-5.3-Flash在DeepSWE v1.1和AutomationBench上的得分分别是多少?
GLM-5.3-Flash在DeepSWE v1.1上取得63.4分,在AutomationBench上取得48.8分。
GLM-5.3-Flash在Toolathlon Verified上的得分与Claude Opus 4.8相比如何?
GLM-5.3-Flash在Toolathlon Verified上取得78.4分,超过Claude Opus 4.8的76.2分。
GLM-5.3-Flash的模型权重在哪里可以下载?使用什么许可证?
GLM-5.3-Flash的模型权重可在Hugging Face下载,采用MIT许可证,允许个人和商业使用,也支持修改后再发布。
GLM-5.3-Flash在正式发布前以什么代号在OpenRouter上测试?
GLM-5.3-Flash在正式发布前以ox-alpha为代号部署在OpenRouter上测试。