TensorSharp 3.3.0.0 发布,视频生成、DFlash2 投机解码、安全加固一起来了 - 张善友

TensorSharp 3.3.0.0 发布,视频生成、DFlash2 投机解码、安全加固一起来了 - 张善友

💡 原文中文,约2700字,阅读约需7分钟。
📝

内容提要

TensorSharp 3.3.0.0 发布,新增 Wan 2.1/2.2 视频生成支持,性能大幅提升;引入 Muse-Glimmer-30B 和 GLM 5.x 推理,优化投机解码速度;修复多项安全漏洞,建议升级。

🔎

延伸解读

视频生成性能提升的关键:自动识别蒸馏模型

本次更新中,TensorSharp 通过文件名自动识别步数蒸馏 checkpoint(如 Turbo、distill 等),自动切换至 4 步推理并关闭 guidance,无需额外参数即可大幅缩短生成时间。例如,在 M5 Pro 上,同一图生视频任务从 3 小时 30 分钟降至 17 分 30 秒。这一机制降低了使用门槛,用户只需更换模型文件即可获得性能提升,但需注意确保模型文件名包含相应关键词,否则可能无法触发优化。

投机解码的架构性改进:设备端状态回滚

针对 Qwen 3.x 等混合架构模型,投机解码此前因 GDN 递归状态无法截断而成为负优化。TensorSharp 通过将状态提交全部保留在设备端,消除了 PCIe 往返开销,使回滚耗时从 3604 ms 降至 0。这一改进不仅提升了速度(如 Qwen3.8-27B 从 19.5 提至 31.7 tok/s),还保证了输出与普通解码逐字节一致。对于依赖投机解码的用户,此修复具有实际意义。

安全加固:服务端升级的必要性

TensorSharp.Server 默认绑定 0.0.0.0 且无内置认证,存在安全风险。本次更新由新贡献者提交约 10 项安全修复,涵盖多个方面。对于对外提供服务的用户,升级至 3.3.0.0 是强烈建议的。此外,用户应检查自身部署环境,确保服务不暴露于不必要的外部网络,以降低潜在风险。

Q&A

TensorSharp 3.3.0.0 版本主要新增了哪些功能?

TensorSharp 3.3.0.0 主要新增了 Wan 2.1/2.2 视频生成支持、Muse-Glimmer-30B 推理支持、GLM 5.x 系列推理支持,以及 DFlash2 投机解码草稿器,并修复了多项安全漏洞。

TensorSharp 是什么?它有哪些特点?

TensorSharp 是一个用 C# 编写的原生 .NET LLM 推理引擎,无需 Python 或 C++,可直接加载 GGUF 模型,提供控制台程序、浏览器聊天界面以及 Ollama/OpenAI 兼容的 HTTP API,支持 Windows、macOS、Linux,后端覆盖 GGML(Metal/CUDA/Vulkan)、直连 CUDA、Apple MLX 和纯 C# CPU 路径。

TensorSharp 3.3.0.0 在视频生成方面有哪些性能提升?

TensorSharp 3.3.0.0 首次支持 Wan 2.1/2.2 视频生成模型,通过自动识别步数蒸馏 checkpoint(如 Turbo、distill 等)并切换到 4 步推理,在 M5 Pro 上处理 1088×832×121 帧的图生视频任务从 3 小时 30 分钟降至 17 分 30 秒;TI2V-5B 可在 16 GB 显卡上 8 分钟内生成 81 帧 480p 图生视频;Wan 2.1 端到端比 stable-diffusion.cpp 快 6 倍。

DFlash2 投机解码解决了什么问题?效果如何?

DFlash2 投机解码解决了 Qwen 3.x 等混合架构模型上投机解码成为负优化的问题,通过将状态提交留在设备端,消除了回滚耗时(从 3604 ms 降至 0)。在 RTX 3080 Laptop 上,Qwen3.8-27B 事实型 prompt 解码速度从 19.5 tok/s 提升到 31.7 tok/s,Muse-Glimmer-30B 从 18.7 提升到 23.0 tok/s,且输出与普通解码逐字节一致。

TensorSharp 3.3.0.0 修复了哪些安全漏洞?

TensorSharp 3.3.0.0 由新贡献者 @craig-b 提交了约 10 项安全修复,主要针对默认绑定 0.0.0.0、无内置认证的服务端,具体漏洞细节未在文中列出,但建议对外提供服务的用户升级。

GLM 5.x 系列在 TensorSharp 3.3.0.0 中如何支持?

TensorSharp 3.3.0.0 支持 GLM-5.2(744B-A40B MoE,1M 上下文)和 GLM-5.3-Flash(320B MoE),支持张量并行和 CPU MoE offload,约 92% 的 routed experts 可放在内存中。GLM-5.2 的 NextN 草稿块随 checkpoint 自带,使用 --spec 参数可提升解码速度约 1.3 倍,草稿接受率高达 94%。

TensorSharp 3.3.0.0 相比 llama.cpp 在性能上有何优势?

根据官方 README,在相同 GGUF 文件和 GPU 上,TensorSharp 在多个模型的 prefill 和首 token 延迟上反超 llama.cpp,最高快 1.28 倍。此外,在 DFlash2 投机解码特性上,llama.cpp 目前还无法加载该草稿器,TensorSharp 暂时独家。

🏷️

标签

➡️

继续阅读