Approaching.AI 利用 Mooncake 构建大规模 LLM 推理基础设施,日均产出超一万亿 token。通过 SGLang HiCache 与 Mooncake Store,将 KV 缓存从单节点资源变为集群共享池,缓存命中率提升至 90% 以上,并解除缓存对调度的限制。自 2026 年 2 月以来,单节点效率提升三倍,总产能增长三十倍。文章还介绍了架构部署、性能优化、稳定性保障及未来方向。
完成下面两步后,将自动完成登录并继续当前操作。