GLM-5.3未改变基础模型——其编码能力提升从何而来?

GLM-5.3未改变基础模型——其编码能力提升从何而来?

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

Z.ai发布GLM-5.3编码与智能体模型,性能较前代提升50%,在终端基准和DeepSWE测试中大幅进步,支持百万级上下文。模型强化后训练,专注实际工作环境,但API定价未公布,旧版本调用自动重定向至新模型,影响对比测试。网络安全能力增强,但漏洞利用仍逊于竞品,权重两周后开放。

🔎

延伸解读

后训练扩展的启示

GLM-5.3与GLM-5.2共享基础模型,性能提升主要来自后训练阶段的强化,包括十倍于前代的长任务环境和完整软件生命周期的模拟。这印证了后训练计算扩展的潜力,与DeepSeek通过优化后训练而非增加参数实现性能超越的思路一致。对开发者而言,这意味着在评估模型时,应关注后训练策略对实际任务的影响,而非仅看参数规模。

基准测试的解读需谨慎

GLM-5.3在Terminal-Bench和DeepSWE等基准上进步显著,但部分数据来自厂商自报,且与竞品的对比受测试环境差异影响。例如,DeepSWE得分与Gemini 3.7 Flash接近,但直接比较需谨慎。建议等待权重开放后,在本地或第三方测试中验证实际性能,避免仅依赖厂商公布的基准数字。

模型迁移的兼容性陷阱

在Z.ai的Coding Plan中,调用GLM-5.2或GLM-5.1的请求会自动重定向至GLM-5.3,这为开发者带来便利,但也可能干扰A/B测试的准确性。若需对比新旧版本,务必检查实际返回的模型ID,确保测试环境的一致性。此外,GLM-5.3的API定价尚未公布,使用前需关注成本变化。

网络安全能力的边界

GLM-5.3在漏洞发现和代码审查方面表现突出,CyberGym得分超过部分竞品,但在漏洞利用环节仍明显落后。这表明模型擅长安全分析的前期阶段,但实际利用和修复能力有限。在评估其安全用途时,应区分发现与利用的差异,避免高估其端到端能力。

Q&A

GLM-5.3相比GLM-5.2在编码性能上提升了多少?

根据Z.ai的内部Code Bench,GLM-5.3相比GLM-5.2性能提升了50%。

GLM-5.3在Terminal-Bench 3.0上的得分是多少?

GLM-5.3在Terminal-Bench 3.0上的得分为28.3,而GLM-5.2为4.6。

GLM-5.3的上下文窗口大小是多少?

GLM-5.3支持100万token的上下文窗口和128,000 token的完成上限。

GLM-5.3在网络安全方面的表现如何?

GLM-5.3在CyberGym上得分84.5%,高于GLM-5.2的77.2%,并略超Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。但在ExploitBench上得分54.4%,仍落后于Mythos 5(78%)和GPT-5.6 Sol(76.5%)。

GLM-5.3的API定价是多少?

Z.ai尚未公布GLM-5.3的官方API定价。在Coding Plan中,GLM-5.3的输入、缓存输入和输出token的乘数高于GLM-4.7,但有50%的off-peak折扣。

GLM-5.3的模型权重何时开放?

Z.ai计划在两周的安全加固和测试后发布GLM-5.3的模型权重。

GLM-5.3在Coding Plan中调用旧版本模型会怎样?

根据Z.ai文档,Coding Plan中调用GLM-5.2或GLM-5.1的请求会自动重定向到GLM-5.3,这可能会影响A/B对比测试的准确性。

GLM-5.3的训练有何特点?

GLM-5.3显著扩展了后训练,暴露于十倍多的长时任务环境,并模拟完整软件生命周期,包括识别bug、编写修复、运行测试和交付结果。Z.ai将计算集中在模型实际工作的特定环境上。

🏷️

标签

➡️

继续阅读