内容提要
智谱发布GLM-5.3开源模型,在编程和安全能力上显著提升,编程接近Claude Fable 5,安全测试获84.5%成最强开源安全模型。实测中能自主完成复杂编程任务、修复漏洞并通过回归测试,强调生产级AI需兼顾代码交付与安全验证。
延伸解读
安全能力成为开源模型新焦点
GLM-5.3在CyberGym白盒代码审查中得分84.5%,超过Mythos 5和GPT-5.6 Sol,成为最强开源安全模型。这标志着开源模型竞争从单纯追求编程能力转向兼顾安全验证。智谱联合清华、南开等机构进行密集红队测试,累计发现2404个漏洞,其中1088个为中高危,覆盖系统内核、浏览器引擎等220个项目,甚至追溯到40年前的Bug。
从写代码到交付软件:Coding Agent的进化
实测中,GLM-5.3不仅能完成指环王基准和3D手表解构等演示级任务,还能自主开发包含前端、后端、数据库、权限和测试的完整模拟游戏,并输出验收报告。这表明Coding Agent已从生成代码片段进化为可交付生产级软件的工具,但同时也意味着模型需要处理更复杂的工程问题,如权限管理和数据持久化。
安全审计与修复:模型需具备漏洞推理能力
在AegisDesk测试中,GLM-5.3能识别12类漏洞,包括明文密码、Stored XSS、Mass Assignment提权等,并能合并同根因的IDOR漏洞。修复时,它补充了回归测试并全部通过。这要求模型不仅能看到可疑代码,还要理解漏洞成立的完整攻击链,并在修复后验证业务未被破坏。
生产级AI的边界意识:区分验证与推断
在无GPU环境下,GLM-5.3硬写CUDA时,主动区分VERIFIED、INFERRED和UNVERIFIED,对无法验证的部分明确标注。这种“知道自己不知道”的能力是安全性的重要组成部分,因为Coding Agent获得系统权限后,一次判断失误的后果会被放大。
Q&A
GLM-5.3在编程能力上相比前代有哪些提升?
GLM-5.3在编程能力上显著提升,在多项主流基准测试中成为排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。在High档位下,能以更低的Token消耗达到超过Claude Opus 4.8最高档位的准确率。实测中能自主完成复杂编程任务,如生成3D场景、构建可交互的3D手表解构Demo,以及开发包含前端、后端、数据库、权限和测试的完整模拟游戏。
GLM-5.3在安全测试中取得了什么成绩?
在CyberGym白盒代码审查中,GLM-5.3拿到84.5%的分数,相比5.2的77.2%继续提升,略高于Mythos 5和GPT-5.6 Sol,成为最强开源安全模型。
GLM-5.3发布前进行了哪些安全测试?
发布前两周,智谱联合清华、南开及国内众多企业、实验室开展了密集的红队测试与安全评估,累计发现漏洞2404个(经过初筛、去重),其中1088个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等220个项目,最早的Bug可追溯到40年前。
GLM-5.3在安全审计中能发现哪些类型的漏洞?
在AegisDesk测试中,GLM-5.3能发现明文密码、Stored XSS、Mass Assignment提权、跨用户IDOR、路径穿越等12类漏洞,并能识别共同根因,合并相关漏洞。
GLM-5.3修复漏洞的能力如何?
在修复测试中,GLM-5.3根据自己生成的审计报告,在9分20秒内修改了22个文件,新增1463行代码,修复了路径穿越、IDOR、Stored XSS和明文密码等问题,并补充了回归测试,最终54项测试全部通过。
GLM-5.3在没有GPU的情况下如何处理CUDA任务?
在无GPU环境下,GLM-5.3先确认本机无法运行CUDA,然后拆分任务:用CPU模拟测试验证算法逻辑,通过Docker中的CUDA Toolkit运行nvcc编译,但对真实GPU执行、数值一致性和性能基准测试均标记为UNVERIFIED,体现了其“知道自己不知道”的安全意识。
为什么GLM-5.3强调安全能力?
因为Coding Agent已能直接操作真实系统,权限增大,一次失误的后果被放大。安全从流程末端前移,成为工程能力的一部分。GLM-5.3强调安全是为了确保模型在获得系统权限后能理解漏洞成因,并具备修复和验证能力,满足生产级AI的需求。
GLM-5.3在安全测试中如何区分验证状态?
GLM-5.3在无GPU的CUDA任务中,主动区分VERIFIED、INFERRED和UNVERIFIED,明确哪些结论已实际验证,哪些是推断,哪些未验证,体现了其证据意识。