更小、更快、更安全:大规模运行Kimi和GLM

💡 原文英文,约1700词,阅读约需6分钟。
📝

内容提要

Cloudflare Workers AI通过三项技术优化Kimi和GLM等大型MoE模型的推理效率:量化KV缓存至FP8,使上下文容量翻倍且成本降低30%;压缩模型权重至INT4,减少40%内存占用并提升解码速度;引入KV缓存完整性检查,确保共享缓存安全,开销低于1%。这些优化在保持模型精度不变的前提下,支持更多客户并降低成本。

🔎

延伸解读

量化收益的权衡:并非单纯加速

文章指出,将KV缓存量化为FP8后,单并发下BF16反而略快,但FP8通过提升并发能力,使总吞吐量提升约41%,成本降低约30%。这说明量化优化并非直接加速单请求,而是通过提高内存利用率来增加整体吞吐和降低成本。类似地,INT4权重在解码阶段因减少内存带宽需求而加速,但在预fill阶段因需反量化反而变慢。因此,优化效果需结合具体场景评估。

精度保持的验证方法

文章通过多个基准测试(如GSM8K、MMLU、ARC等)对比量化前后的模型精度,结果显示FP8与BF16、INT4与FP8的精度差异均在0.8个百分点以内,且内部基准(mcxams)通过数几乎一致。这表明量化在保持模型质量方面是可靠的。读者可借鉴此方法,在采用量化技术时,使用类似基准测试验证精度损失是否在可接受范围内。

安全机制的成本控制

KV缓存完整性检查是保障共享缓存安全的关键,但其开销需严格控制。文章实测显示,该检查对吞吐量和p95延迟的影响均低于1%,且通过批量检查而非融合进注意力内核来避免性能损失。这提示在添加安全功能时,应通过设计优化将性能开销降至最低,并支持按需启用,以平衡安全与效率。

Q&A

Cloudflare Workers AI 如何优化 Kimi 和 GLM 等大型 MoE 模型的推理效率?

Cloudflare Workers AI 通过三项技术优化推理效率:量化 KV 缓存至 FP8,使上下文容量翻倍且成本降低 30%;压缩模型权重至 INT4,减少 40% 内存占用并提升解码速度;引入 KV 缓存完整性检查,确保共享缓存安全,开销低于 1%。

量化 KV 缓存至 FP8 带来了哪些具体收益?

量化 KV 缓存至 FP8 将缓存大小减半,使 Kimi K2.6 的上下文容量从约 686,000 tokens 提升至约 1.37 million tokens,同时支持更多并发请求(从 32 提升至 64),峰值吞吐量提高约 41%,成本降低约 30%,且模型精度无明显变化。

将 GLM 模型权重压缩至 INT4 后,内存占用和推理速度有何变化?

将 GLM 5.2 的权重从 FP8 压缩至 INT4 后,模型检查点从 705 GB 降至 421 GB,减少约 40%;每 GPU 内存从约 88 GB 降至 52 GB,为 KV 缓存留出更多空间。解码速度在低并发下提升最高达 55%,但预填充速度略有下降(约 15%)。

为什么 KV 缓存完整性检查是必要的?

由于量化技术使更多请求共享同一 GPU 内存,数百个请求同时读写同一物理 KV 缓存,增加了缓存错误的风险。KV 缓存完整性检查通过为每个缓存页分配标签并验证请求的映射,防止请求读取错误数据,确保共享缓存的安全性。

KV 缓存完整性检查的性能开销是多少?

在测试中,KV 缓存完整性检查的吞吐量影响低于 1%,p95 延迟增加低于 1%,且 95% 置信区间的上限也接近 1%。该检查默认启用,但可通过配置关闭,关闭时无额外开销。

Cloudflare 在推理优化方面未来的计划是什么?

未来计划包括:将 FP8 KV 缓存扩展到更多模型,验证 NVFP4 权重在 Blackwell 架构上的效果,并努力使完整性检查在几乎所有部署中都能以可忽略的成本保持开启。

🏷️

标签

➡️

继续阅读