TensorSharp 纯 .NET 推理引擎于8月19日支持GLM-5.2,在3×RTX PRO 6000上长prompt prefill比llama.cpp快约1.5倍,decode快4%。GLM-5.3同基座、后训练提升,预计8月28日开源,现有支持可无缝承接。此进展将前沿模型私有化部署降至工作站级别,.NET推理栈成可用选项。
TensorSharp于2026年7月31日将DeepSeek V4 Flash(284B参数MoE模型)集成至其.NET推理栈,提供OpenAI兼容接口和连续批处理。其开发了三条路径:直接CUDA后端、ggml后端和纯托管实现,支持多GPU层切分和逐字节一致的并发隔离。性能接近llama.cpp,正确性通过测试,使.NET首次成为可用的大模型推理选项。
完成下面两步后,将自动完成登录并继续当前操作。