内容提要
GLM-5.3发布,基座未变但后训练大幅提升编程能力,代码干净、长任务执行强,Token效率高。但存在死循环耗资源、通用智能弱、无原生视觉等短板。定位为需人类明确指令的强力执行者,适合已理解的任务,不适合探索性工作。
延伸解读
后训练Scaling的潜力与局限
GLM-5.3在不改变基座模型的情况下,通过后训练大幅提升编程能力,证明了后训练Scaling的有效性。但这也意味着模型的通用智能上限受限于基座,在创意写作、头脑风暴等探索性任务上表现较弱。这提醒我们,后训练可以优化特定能力,但无法突破基座模型的根本限制。
长周期执行力的双刃剑效应
GLM-5.3的长周期任务执行能力强,能持续数小时不跑偏,但一旦方向错误,会陷入死循环,消耗大量资源。开发者实测中,单次死循环消耗了周配额的17%。因此,使用这类模型时,明确的任务定义和人工监督至关重要,否则可能造成资源浪费。
开源模型的竞争力与生态影响
GLM-5.3作为开源模型,在编程能力上达到开源第一,甚至在某些基准上超过闭源模型,如Claude Opus 4.8。这显示了开源模型的竞争力,可能推动更多开发者采用开源方案。但开源模型的性能提升依赖于后训练技术,这需要强大的工程能力,并非所有团队都能复制。
Q&A
GLM-5.3相比GLM-5.2有哪些提升?
GLM-5.3在基座模型不变的情况下,通过后训练大幅提升了编程能力,内部编程体感评测提升50%,Terminal Bench 3.0从4.6分提升到28.3分,DeepSWE v1.1从46.2提升到66.9。同时,网络安全能力增强,在CyberGym基准测试中得分84.5,超过Claude Mythos 5的83.8。此外,Token效率更高,长周期任务执行能力更强。
GLM-5.3在编程方面有哪些优点?
GLM-5.3的代码干净,结构稳定,命名一致,易于阅读;长周期任务执行能力强,能持续数小时不跑偏;Token消耗比GLM-5.2大幅下降;前端能力也有明显进步,设计有自己的风格。
GLM-5.3存在哪些主要缺点?
GLM-5.3的主要缺点包括:容易陷入死循环,浪费大量资源;通用智能较弱,创意写作和头脑风暴等探索性任务表现不佳;没有原生视觉能力;语音风格缺乏原创性,类似Fable;速度不稳定,高峰时段可能慢2-3倍。
GLM-5.3适合哪些使用场景?
GLM-5.3适合处理用户已经理解的问题,并且需要明确指令和定义好的工作流程。在编程、长周期任务执行、网络安全等场景表现出色。不适合探索性工作,如创意写作、头脑风暴,或需要模型自主思考的任务。
GLM-5.3的基座模型和架构有什么特点?
GLM-5.3的基座模型与GLM-5.2相同,总参数规模约7430亿,采用混合专家架构,上下文窗口为100万Token。基座未变,但通过后训练大幅提升了能力。
GLM-5.3在网络安全方面表现如何?
GLM-5.3在网络安全方面表现出色,CyberGym基准测试得分84.5,超过Claude Mythos 5的83.8。实际应用中,已在269个软件项目中发现超过2400个安全漏洞,其中约1097个属于高危或严重级别,最夸张的一个漏洞藏在约40年前写的代码中。
GLM-5.3的后训练技术有哪些特点?
GLM-5.3的后训练采用了极致的后训练Scaling,将训练任务环境规模扩展了几十倍,加入更丰富的长程任务类型,配合超长时间的强化学习。训练任务相当于高级工程师连续干好几天的活,模型需要操作计算集群、读写存储系统、翻阅内部文档和代码库。技术栈基于slime和SAO两个开源项目,并搭建了能自动生成奖励信号的数据管道。
GLM-5.3与Kimi K3、Fable等模型相比如何?
GLM-5.3在编程和长周期任务上表现优于Kimi K3和Fable,但通用智能明显落后于Kimi K3,且会自信地报告未完成的任务。在指令清晰度上,GLM-5.3属于第二梯队,需要一定程度的明确指引,而Fable能处理超级模糊的指令。