内容提要
智谱GLM-5.3-Flash在超10万颗国产AI加速器上两周完成部署,吞吐提升3.2倍。GLM-5.3驱动的Infra Agent参与优化,定位精度与调度问题,将KV传输开销从30%降至1%以下。团队提出dense feedback机制,让AI理解性能变化原因。唐杰称递归自我改进的早期形态已现:模型优化系统,系统服务模型。
延伸解读
国产算力集群的工程挑战
GLM-5.3-Flash 在超过 10 万颗国产 AI 加速器上完成部署,面临显存容量、互联带宽限制、新模型架构适配、百万 token 长上下文及多模态请求等难题。国产软件生态尚在发展,部分 Kernel 支持不足,团队需自行探索。这些限制条件使得优化必须在算力、内存、通信和调度间寻找新平衡,而非简单堆叠资源。
Infra Agent 如何参与优化
由 GLM-5.3 驱动的 Infra Agent 参与了推理系统优化,帮助分析性能瓶颈、提出方案并修改代码。它定位了 KDA 上下文并行路径中的精度累积误差问题,以及 KV Transfer 与 DeepEP 调度未重叠导致传输开销超 30% 的问题,通过释放 Python GIL 将开销降至 1% 以下。Agent 还优化了 Decode Kernel,减少重复计算,获得 1.71 倍性能提升。
dense feedback 机制的意义
唐杰指出,Agent 的困难往往不是写代码,而是判断“为什么结果变差”。dense feedback 机制让 Agent 获得接近工程判断的反馈:确认计算正确性、查看时间消耗、通过实验验证优化方案。有效反馈需接近具体问题、快速获得且可客观验证,否则大量日志反而干扰决策。这使 Agent 能定位隐藏问题,而人类工程师转向设定目标、搭建反馈环境和审核高风险修改。
递归自我改进的早期形态
唐杰认为,虽然距离真正的递归自我改进(RSI)仍远,但最小循环已出现:模型优化系统,系统服务模型。GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 运行,一周内成为使用量最高模型之一,六天处理超 62 万亿 token。团队表示,建立在真实基础设施任务上的可验证反馈环境,可能成为训练下一代模型的重要基础,每次 Agent 完成任务都可能成为学习数据。
Q&A
智谱GLM-5.3-Flash在国产AI加速器上部署用了多长时间?吞吐提升多少?
从首次运行到完成全部生产流量承载仅用两周时间,系统端到端吞吐能力提升了3.2倍。
Infra Agent在优化过程中具体解决了哪些问题?
Infra Agent定位了KDA上下文并行路径中因TF32舍入误差累积导致的长上下文计算精度问题,并修复合并到Flash Linear Attention项目PR #1180;发现KV Transfer与DeepEP调度未有效重叠导致传输开销超30%,通过释放Python GIL将开销降至1%以下;还优化了一个Decode Kernel,通过重新组织计算结构减少重复计算,获得1.71倍性能提升。
什么是dense feedback机制?它为什么重要?
dense feedback是智谱团队提出的反馈机制,旨在让AI Agent获得更接近工程判断过程的信息,例如正确性反馈、性能时间消耗、实验验证结果等。它重要是因为Agent遇到困难时往往不是无法写代码,而是无法判断“为什么结果变差”,dense feedback能帮助Agent定位问题、验证假设,从而有效优化系统。
唐杰如何描述当前AI自我改进的进展?
唐杰认为,虽然距离真正意义上的递归自我改进(RSI)仍然很远,但一种早期形态已经出现:模型优化系统,系统服务模型。他称这是一个最小规模的循环。
GLM-5.3-Flash在部署中面临哪些挑战?
挑战包括国产芯片显存容量和互联带宽限制、新模型架构适配、100万token长上下文支持、多模态请求处理,以及国产AI加速器软件生态不成熟、部分Kernel支持不足、资料需自行探索等。
GLM-5.3-Flash在真实环境测试中表现如何?
该模型曾以匿名模型名Ox-Alpha运行在OpenCode和OpenRouter平台,一周内成为两个平台使用量最高的模型之一,六天处理超过62万亿token。