内容提要
TensorSharp 纯 .NET 推理引擎于8月19日支持GLM-5.2,在3×RTX PRO 6000上长prompt prefill比llama.cpp快约1.5倍,decode快4%。GLM-5.3同基座、后训练提升,预计8月28日开源,现有支持可无缝承接。此进展将前沿模型私有化部署降至工作站级别,.NET推理栈成可用选项。
延伸解读
性能优势的适用边界
TensorSharp 在长 prompt prefill 上显著快于 llama.cpp,但短 prompt 时略慢,decode 仅快约 4%。测试使用 2-bit 量化(UD-IQ2_XXS),且为作者自报基准。因此,性能优势主要体现于长上下文场景,实际部署需结合自身负载特点评估。
硬件配置与部署门槛
3× RTX PRO 6000 工作站配置(约 288 GB 显存)可将 226 GiB 的 2-bit GLM-5.2 权重按层切分运行,prefill 超 1000 tok/s。相比 BF16 需 8×H100,此配置大幅降低私有化部署成本,但三卡 PCIe 直连无 NVLink,导致张量并行不划算,需注意硬件拓扑对性能的影响。
GLM-5.3 兼容性展望
GLM-5.3 与 5.2 同基座,仅后训练差异,因此 TensorSharp 现有 glm-dsa 支持大概率可直接承接。但需关注两点:GLM-5.3 是否沿用 glm-dsa 架构 id,以及是否新增多模态能力(当前 TensorSharp 仅支持文本)。权重开源后,社区量化与兼容性验证是关键信号。
Q&A
TensorSharp 是什么?它最近有什么新进展?
TensorSharp 是一个纯 .NET 的推理引擎,由 Zhongkai Fu 开发。最近,它在 2026 年 8 月 19 日合并了 PR #163,正式支持 GLM-5.2 模型,并在 3× RTX PRO 6000 上实现了比 llama.cpp 更快的长 prompt prefill 和略快的 decode 速度。
TensorSharp 在支持 GLM-5.2 时,与 llama.cpp 相比性能如何?
在 3× RTX PRO 6000 上,TensorSharp 在 prompt 长度约 1000 token 以上时 prefill 反超,pp2048 达到 1145.8 tok/s,而 llama.cpp 为 763.1 tok/s(约 1.50 倍),pp4096 约 1.47 倍;decode(tg64)也快约 4%。但短 prompt 时 llama.cpp 领先几个百分点,decode 两者接近。
GLM-5.3 与 GLM-5.2 有什么关系?TensorSharp 能否直接支持 GLM-5.3?
GLM-5.3 与 GLM-5.2 使用同一基座模型,性能提升全部来自后训练,未改变底层架构。因此,只要 GLM-5.3 的 GGUF 仍使用 glm-dsa 架构,TensorSharp 现有的支持大概率可以直接承接,无需大量适配。
TensorSharp 为 GLM-5.2 提供了哪些实现?它们有什么特点?
TensorSharp 为 GLM-5.2 提供了两套实现,均以 llama.cpp 的 glm-dsa.cpp 为基准:一套基于 ggml(支持 CUDA、Vulkan、CPU、Metal),另一套是纯 C# 的 CPU 实现(TS_GLM_NATIVE=0)。多卡策略上,默认的按层切分在 PCIe 直连无 NVLink 的机器上优于张量并行。
TensorSharp 如何实现并发服务?批量解码有什么效果?
TensorSharp 使用原生 per-sequence slot 契约,并实现了批量融合解码(TS_BATCHED_FUSED_DECODE=1),将多个序列的 token 合并到一张计算图中,共享投影、路由和专家计算。实测 4 路并发 200 token 补全合计 75.2 tok/s,是单流 41.6 tok/s 的 1.81 倍。
TensorSharp 如何确保与 llama.cpp 的输出一致性?
TensorSharp 采用“逐字节对齐”的验收标准,通过记录 prompt token id 进行前向对比,隔离分词差异。在 GLM-5.2-UD-IQ2_XXS 上,ggml_cuda 三卡 6/6 逐 token 一致,ggml_cpu 3/3,纯托管 cpu 1/1。此外,它刻意复现了 Hadamard 旋转,以保证与 llama.cpp 的 top-k 选择一致。
TensorSharp 如何确定上下文长度?为什么?
TensorSharp 将 GGUF 宣称的 1M 上下文视为上限,实际根据设备剩余显存动态确定。在三张 RTX PRO 6000 上,默认层切分选出 342,272 token,--n-cpu-moe 30 可抬到 646,400,--tp 3 只能选出 91,136。这种策略避免了静默截断或 OOM 崩溃。
GLM-5.2 的部署门槛如何?TensorSharp 如何降低门槛?
GLM-5.2 的 BF16 全精度需要约 1.5 TB 显存,FP8 约 750 GB,Q4_K_M GGUF 约 376-476 GB,而 2-bit UD-IQ2_XXS 量化后约 226 GiB,3× RTX PRO 6000(共 288 GB)即可承载。TensorSharp 还支持 --n-cpu-moe 将路由专家卸载到系统内存,进一步降低显存需求。
GLM-5.3 的开源时间是什么时候?TensorSharp 社区应关注哪些信号?
GLM-5.3 预计在 2026 年 8 月 28 日前后开源(官方口径为“下周五”)。社区应关注 GLM-5.3 的 GGUF 是否沿用 glm-dsa 架构 id,以及 TensorSharp 能否延续逐 token 对齐的纪录。