内容提要
TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。
延伸解读
架构同构加速适配
GLM-5.3-Flash 与 Qwen3.8-Flash-Next 均采用线性注意力与稀疏注意力混合的架构,TensorSharp 在三天内完成两个新架构的接入,说明其模型层抽象能适应范式切换,而非为每个模型打补丁。对 .NET 团队而言,这意味着前沿模型的支持速度可能不再是采用本地推理的瓶颈。
性能数据的可信度
TensorSharp 在 decode 速度上达到 llama.cpp 的 2 倍,prefill 持平,这与 KV 缓存大幅缩小的理论预期一致,数据自洽。但需注意测试条件:同机同权重、2× RTX PRO 6000、UD-Q2_K_XL 量化、层切分等,实际性能会因硬件、量化、批处理设置而异,建议在自身环境验证。
工程边界与部署考量
TensorSharp 明确不支持张量并行,需用层切分;投机解码尚未实现。--cpu-moe 可将大部分专家权重放在内存,但会显著降低速度(如 GLM-5.2 上从 915.9 降至 94.7 tok/s),是“能跑”与“跑得快”的取舍。对合规要求高的场景,纯托管代码的可审计性可能比性能更重要。
Q&A
TensorSharp 是什么?
TensorSharp 是一个纯 .NET 的 LLM 推理引擎,基于 .NET 10,直接读取 GGUF 权重,提供 CLI、交互式 REPL、ASP.NET Core Web UI 以及 Ollama/OpenAI 兼容的 HTTP API。它支持进程内推理,无需外部 Python 或 C++ 进程。
TensorSharp 在性能上相比 llama.cpp 有何优势?
在 GLM-5.3-Flash 的测试中,TensorSharp 的 decode 速度达到 73.5 tok/s,是 llama.cpp 的 36.6 tok/s 的 2 倍;prefill 速度两者基本持平(如 pp2048 为 2014 vs 2070)。这得益于 KV 缓存大幅缩小。
GLM-5.3-Flash 的架构有什么特点?
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,320B 总参、18B 激活的 MoE。45 层主干中 34 层用 KDA 线性注意力,11 层用 NoPE MLA + 稀疏注意力,残差是 ×4 流形约束超连接。KV 缓存较 GLM-5.3 降约 4.4 倍。
TensorSharp 如何实现多模态支持?
TensorSharp 通过 GLM-OCR ViT 的 mmproj-BF16.gguf 接入多模态,支持多图与多轮会话。
TensorSharp 在并发处理上有什么特点?
TensorSharp 使用 per-sequence state holder,每个在途请求持有自己的全套状态,切换请求时只交换引用,不搬移状态字节,也不重建图,从而支持并发且不降低性能。
TensorSharp 如何保证正确性?
TensorSharp 使用记录下来的 token id 进行前向对比,与同后端 llama.cpp 逐 token 对齐;并发 slot 输出与单流温度 0 的结果逐字节一致;批量 decode 默认关闭,因为会改变 GEMM 形状并放大路由分歧。
TensorSharp 支持哪些部署方式?
TensorSharp 支持进程内推理,无需 Python 环境、WSL 或容器。它提供 CLI、REPL、Web UI 和 HTTP API。还支持 --cpu-moe 将路由专家放在系统内存,使显存不足的机器也能运行。
TensorSharp 对 .NET 团队有什么意义?
TensorSharp 使 .NET 团队能够将 LLM 推理集成到自己的进程中,无需外部进程,且支持前沿模型架构的快速跟进。它提供了可审计的托管代码,适合合规要求高的场景,值得纳入 PoC 评估。