PrismML发布Ternary Bonsai 2 27B三元量化多模态模型,27.36B参数压缩至5.9GB,保留基座98.2%分数。但权重存于旋转基底,运行时需执行Walsh-Hadamard变换,原版llama.cpp与Ollama无法运行。TensorSharp通过显式校验变换契约、转码自定义格式接入该模型,拒绝静默跑错,代价是内存增加6%至29%,性能略慢于官方基线。
TensorSharp 合并 PR #225,其纯 .NET 推理引擎新增 Jev 结构化读取模式,可运行 Google DiffusionGemma-26B-A4B 文本扩散模型。Jev 仅处理是/否、多选、评分等有边界问题,返回概率与置信度,不做开放式生成。相比 LocalJev 的 JSON 生成加校验重试,该方案直接从扩散模型 logits 读取答案,同硬件下快 4–5 倍,支持 HTTP 与进程内调用。
TensorSharp 3.3.0.0 发布,新增 Wan 2.1/2.2 视频生成支持,性能大幅提升;引入 Muse-Glimmer-30B 和 GLM 5.x 推理,优化投机解码速度;修复多项安全漏洞,建议升级。
vLLM的并行限制源于注意力头数需被TP大小整除,而非固定1/2/4/8卡;llama.cpp采用层切分,通信量小,卡数影响不大,关键在互联类型。TensorSharp引擎同时支持层切分和张量并行,3卡跑744B模型性能超llama.cpp,但TP对互联敏感,2卡仅提升1.4倍。核心结论:层切分对卡数免疫,TP对互联敏感。
TensorSharp 纯 .NET 推理引擎于8月19日支持GLM-5.2,在3×RTX PRO 6000上长prompt prefill比llama.cpp快约1.5倍,decode快4%。GLM-5.3同基座、后训练提升,预计8月28日开源,现有支持可无缝承接。此进展将前沿模型私有化部署降至工作站级别,.NET推理栈成可用选项。
TensorSharp于2026年7月31日将DeepSeek V4 Flash(284B参数MoE模型)集成至其.NET推理栈,提供OpenAI兼容接口和连续批处理。其开发了三条路径:直接CUDA后端、ggml后端和纯托管实现,支持多GPU层切分和逐字节一致的并发隔离。性能接近llama.cpp,正确性通过测试,使.NET首次成为可用的大模型推理选项。
完成下面两步后,将自动完成登录并继续当前操作。