Kimi以存储换计算:吞吐量暴涨115%,空头错看了哪张底牌?

Kimi以存储换计算:吞吐量暴涨115%,空头错看了哪张底牌?

💡 原文中文,约4200字,阅读约需10分钟。
📝

内容提要

Mooncake架构通过分布式KV Cache缓存池,将Kimi请求吞吐量提升115%,获存储顶会最佳论文。它分离预填充与解码节点,全局共享缓存,解决长上下文瓶颈。该架构拉动DRAM、光模块、SSD需求,开源生态正跟进,成为行业标准。

🔎

延伸解读

空头误判:缓存压缩不等于缓存无用

空头认为KDA压缩缓存后,分布式缓存池不再必要,但忽略了前缀复用率才是吞吐量关键。Mooncake论文显示,本地DRAM只能支撑理论命中率的50%,其余必须靠全局缓存池。KDA解决单token占用,Mooncake解决多请求共享,两者维度不同,空头混淆了技术层次。

分离架构:预填充与解码解耦的收益

传统做法将预填充和解码放在同一GPU,导致算力和内存资源无法同时充分利用。Mooncake分离节点,预填充节点专注计算,解码节点专注存储和生成,通过RDMA传输KV Cache。论文指出,100Gbps网卡(约12.5GB/s)已足够支撑LLaMA3-70B的缓存复用,带宽不再是瓶颈。

调度器Conductor:在延迟与吞吐间平衡

Conductor通过四步流程优化请求处理,但面临TTFT和TBT的权衡。它采用热点缓存多副本、冷数据swap到SSD,并预测负载以提前拒绝请求,避免浪费算力。真实流量下,有效请求容量提升59%到498%,SLO越严格优势越明显,因为全局缓存复用降低了预填充时间。

产业链新需求:内存、光模块与SSD

分布式缓存池将DRAM从GPU附属变为独立资源池,提升DDR5需求;RDMA网络依赖高速光模块和光纤,东西向流量增加;SSD作为DRAM溢出层,为QLC SSD在AI推理中提供新角色。这些硬件需求因Mooncake架构而获得明确增量。

Q&A

Mooncake架构如何提升Kimi的吞吐量?

Mooncake通过分布式KV Cache缓存池,将预填充和解码节点分离,全局共享缓存,使Kimi在A800集群上多扛115%的请求,在H800集群上多扛107%的请求。

为什么华尔街空头对Kimi的看空逻辑是错误的?

空头认为KDA压缩缓存后分布式缓存池不再必要,但忽略了前缀复用率才是吞吐量的关键。Mooncake解决的是全局缓存共享问题,与KDA解决的单token内存占用问题不在同一维度。

Mooncake的预填充和解码分离架构有什么优势?

传统架构将预填充和解码放在同一GPU上,导致资源利用率低。Mooncake将预填充节点专门负责计算,解码节点专门负责存储和生成,通过高速RDMA网络传输KV Cache,避免了资源浪费,提升了整体效率。

Mooncake Store如何实现分布式KV Cache缓存池?

Mooncake Store将集群中闲置的CPU、DRAM、SSD和RDMA网卡整合为分布式缓存池,按页块存储KV Cache,使用哈希键去重,采用LRU淘汰策略,并通过传输引擎优化数据传输,全局缓存命中率是本地缓存的2.36倍,节省48%的预填充计算时间。

Conductor调度器如何平衡缓存复用和延迟?

Conductor通过四步流程(复用前缀缓存、增量预填充、异步传输、连续批处理)调度请求,并采用热点缓存多副本、冷数据swap到SSD、短期负载预测等策略,在最大化缓存复用的同时控制TTFT和TBT,有效请求容量提升59%到498%。

Mooncake在长上下文场景下相比vLLM有哪些优势?

Mooncake采用CPP(分块流水线并行)减少网络消耗,在真实负载下,不同TBT SLO约束下请求容量比vLLM提升59%到498%,SLO越严格优势越明显。

Mooncake架构对硬件产业链有哪些影响?

Mooncake拉动DRAM需求(作为独立资源池)、光模块和光纤(RDMA网络需要高速互联)、SSD(作为冷数据溢出层),推动AI服务器中DDR5、高速光模块和QLC SSD的采用。

哪些开源项目已经支持Mooncake?

vLLM(2024年12月)、SGLang(2025年4月)、LMCache(2025年4月)和NVIDIA NIXL(2025年5月)均已支持Mooncake的Transfer Engine或Store,表明其架构正成为行业标准。

🏷️

标签

➡️

继续阅读