内容提要
Mooncake架构通过分布式KV Cache缓存池,将Kimi请求吞吐量提升115%,获存储顶会最佳论文。它分离预填充与解码节点,全局共享缓存,解决长上下文瓶颈。该架构拉动DRAM、光模块、SSD需求,开源生态正跟进,成为行业标准。
延伸解读
空头误判:缓存压缩不等于缓存无用
空头认为KDA压缩缓存后,分布式缓存池不再必要,但忽略了前缀复用率才是吞吐量关键。Mooncake论文显示,本地DRAM只能支撑理论命中率的50%,其余必须靠全局缓存池。KDA解决单token占用,Mooncake解决多请求共享,两者维度不同,空头混淆了技术层次。
分离架构:预填充与解码解耦的收益
传统做法将预填充和解码放在同一GPU,导致算力和内存资源无法同时充分利用。Mooncake分离节点,预填充节点专注计算,解码节点专注存储和生成,通过RDMA传输KV Cache。论文指出,100Gbps网卡(约12.5GB/s)已足够支撑LLaMA3-70B的缓存复用,带宽不再是瓶颈。
调度器Conductor:在延迟与吞吐间平衡
Conductor通过四步流程优化请求处理,但面临TTFT和TBT的权衡。它采用热点缓存多副本、冷数据swap到SSD,并预测负载以提前拒绝请求,避免浪费算力。真实流量下,有效请求容量提升59%到498%,SLO越严格优势越明显,因为全局缓存复用降低了预填充时间。
产业链新需求:内存、光模块与SSD
分布式缓存池将DRAM从GPU附属变为独立资源池,提升DDR5需求;RDMA网络依赖高速光模块和光纤,东西向流量增加;SSD作为DRAM溢出层,为QLC SSD在AI推理中提供新角色。这些硬件需求因Mooncake架构而获得明确增量。
Q&A
Mooncake架构如何提升Kimi的吞吐量?
Mooncake通过分布式KV Cache缓存池,将预填充和解码节点分离,全局共享缓存,使Kimi在A800集群上多扛115%的请求,在H800集群上多扛107%的请求。
为什么华尔街空头对Kimi的看空逻辑是错误的?
空头认为KDA压缩缓存后分布式缓存池不再必要,但忽略了前缀复用率才是吞吐量的关键。Mooncake解决的是全局缓存共享问题,与KDA解决的单token内存占用问题不在同一维度。
Mooncake的预填充和解码分离架构有什么优势?
传统架构将预填充和解码放在同一GPU上,导致资源利用率低。Mooncake将预填充节点专门负责计算,解码节点专门负责存储和生成,通过高速RDMA网络传输KV Cache,避免了资源浪费,提升了整体效率。
Mooncake Store如何实现分布式KV Cache缓存池?
Mooncake Store将集群中闲置的CPU、DRAM、SSD和RDMA网卡整合为分布式缓存池,按页块存储KV Cache,使用哈希键去重,采用LRU淘汰策略,并通过传输引擎优化数据传输,全局缓存命中率是本地缓存的2.36倍,节省48%的预填充计算时间。
Conductor调度器如何平衡缓存复用和延迟?
Conductor通过四步流程(复用前缀缓存、增量预填充、异步传输、连续批处理)调度请求,并采用热点缓存多副本、冷数据swap到SSD、短期负载预测等策略,在最大化缓存复用的同时控制TTFT和TBT,有效请求容量提升59%到498%。
Mooncake在长上下文场景下相比vLLM有哪些优势?
Mooncake采用CPP(分块流水线并行)减少网络消耗,在真实负载下,不同TBT SLO约束下请求容量比vLLM提升59%到498%,SLO越严格优势越明显。
Mooncake架构对硬件产业链有哪些影响?
Mooncake拉动DRAM需求(作为独立资源池)、光模块和光纤(RDMA网络需要高速互联)、SSD(作为冷数据溢出层),推动AI服务器中DDR5、高速光模块和QLC SSD的采用。
哪些开源项目已经支持Mooncake?
vLLM(2024年12月)、SGLang(2025年4月)、LMCache(2025年4月)和NVIDIA NIXL(2025年5月)均已支持Mooncake的Transfer Engine或Store,表明其架构正成为行业标准。