内容提要
智谱AI发布GLM-5.3,基座与5.2相同,仅靠后训练将编程分数提升六倍,并意外涌现网络安全能力,引发刷榜争议。模型效率高,成本低于闭源对手,但真实水平待开源验证,闭源巨头实力成谜。
延伸解读
后训练为何能带来如此大的提升?
文章指出,GLM-5.3与5.2基座完全相同,仅靠后训练就将编程分数提升六倍,并意外涌现网络安全能力。这引发疑问:如果后训练能如此大幅提升性能,是否意味着现有基座模型的智能潜力远未被充分开发?智谱官方也承认“可能还未开发出基座的智能上界”。这提示我们,后训练可能是释放模型潜力的关键环节,其重要性可能被此前低估。
刷榜争议与验证困境
GLM-5.3的分数暴涨引发“刷榜”质疑,因为其提升集中在编程和智能体测试,且Terminal-Bench是新榜单。但若刷榜发生在预训练阶段,5.2也应受影响,因此后训练阶段可能被“针对性优化”。智谱自建内部基准Z.ai Code Bench验证提升约50%,但内部基准的客观性难以保证。这凸显了公开基准可能被污染,而独立验证需待权重开源后由社区完成。
效率优势或成落地关键
文章强调,GLM-5.3在Z.ai Code Bench High档位用约5万Token达到31.4%准确率,而Claude Opus 4.8用12万Token仅29.5%。这意味着GLM-5.3在成本上具有显著优势,单次任务成本约0.22美元,远低于对手的0.53美元。在真实编程任务中,Token消耗直接决定成本,因此效率优势可能比单纯分数更有实际意义,尤其对于大规模部署场景。
开源与闭源的未知博弈
文章指出,闭源巨头如OpenAI和Anthropic从未公布真实参数规模,外界猜测其模型可能比公开版本小得多或大得多。GLM-5.3逼近Claude Fable 5的表现,引发对闭源模型真实实力的猜测。此外,智谱计划两周后开源权重,但模型强大的漏洞挖掘能力引发安全担忧,开源可能带来风险。这场开源与闭源的竞争,其真实差距可能远超公开榜单所示。
Q&A
GLM-5.3相比GLM-5.2在编程能力上提升了多少?
GLM-5.3在Terminal-Bench 3.0上的得分从4.6提升到28.3,提升了约6倍;在DeepSWE v1.1上从46.2提升到66.9。
GLM-5.3的基座模型与GLM-5.2有何不同?
GLM-5.3的基座模型与GLM-5.2完全相同,所有提升都来自后训练。
什么是后训练?为什么后训练能带来如此大的性能提升?
后训练是在基座模型预训练之后进行的针对性训练,将知识转化为实际能力。文章指出,后训练能带来巨大提升,说明基座模型的智能上界可能远未开发。
GLM-5.3在网络安全方面有哪些表现?
GLM-5.3在CyberGym漏洞推理评测上得分84.5%,超过Claude Mythos 5和GPT-5.6 Sol;在ExploitBench上得分从24.4提升到54.4;两周内挖出2436个漏洞,包括一个潜伏四十多年的DNS协议级漏洞。
GLM-5.3的Token效率如何?与闭源模型相比有何优势?
在Z.ai Code Bench High档位测试中,GLM-5.3用约5万Token达到31.4%准确率,而Claude Opus 4.8用约12万Token达到29.5%。GLM-5.3的Token消耗不到对方一半,成本更低。
GLM-5.3的发布引发了哪些争议?
主要争议包括:性能提升是否因刷榜(数据污染)、内部基准的客观性、网络安全能力是否意外涌现、以及闭源模型真实实力成谜。
GLM-5.3的权重何时开放?为什么有延迟?
GLM-5.3将在发布两周后开放完整权重,延迟是为了完成安全评估和加固,因为模型可能被用于漏洞挖掘,需要防范风险。