本文介绍作者用Rust重写Mooncake存储模块为Suncake项目,通过Qoder和Qwen3.8从零开发,仅用37个提交完成。相比C++版,性能提升显著:墙钟时间约为C++的52%,get尾部延迟改善数百倍,线程数从266降至21。作者认为Rust的async/await更适合IO密集型应用,并指出项目零单测等弱点。
本文介绍了Mooncake如何优化强化学习(RL)系统中从推理到训练的数据传输。RL的rollout数据异构且内存碎片化,Mooncake通过结构化编码和批量I/O,将Miles框架的GET速度提升约10-14倍,PUT提升1.2-1.6倍,同时保持数据结构和语义不变,支持异步流水线,提高整体效率。
本文介绍Mooncake分布式KV存储系统中,因一行配置代码引发分布式死锁的案例。在写入路径启用direct reclaim后,本地master的io线程等待其他节点响应,形成循环等待,导致集群大面积挂起。文章强调系统安全性依赖等待图单向性,任何改变都可能破坏这一前提。
Kimi K3采用KDA与MLA混合注意力架构,引入循环状态缓存,改变传统KV缓存语义。Mooncake与SGLang、vLLM、TokenSpeed合作,实现KDA感知的检查点管理、跨实例缓存复用及统一数据传输平面,支持百万级长上下文推理,降低冗余计算,提升多轮对话和智能体任务效率。
Mooncake架构通过分布式KV Cache缓存池,将Kimi请求吞吐量提升115%,获存储顶会最佳论文。它分离预填充与解码节点,全局共享缓存,解决长上下文瓶颈。该架构拉动DRAM、光模块、SSD需求,开源生态正跟进,成为行业标准。
Mooncake SSD离线存储解决了KV缓存的存储效率问题,通过将长尾KV块存储在SSD上,提高了缓存命中率,减少了重新计算的开销。系统支持异步数据传输,优化了SSD数据路径,提升了整体性能。未来计划包括GPU直接存储和分布式存储后端的集成,以进一步提高效率。
本文讨论了Mooncake Store在统一内存池、local master和softpin语义方面的演进,强调了主动释放lease和故障注入的重要性,以提高系统性能和稳定性。整体设计旨在应对高并发场景下的挑战。
本文讨论了 C++ 中内存池管理的一个 bug,特别是 KeyEvictInfo.iter_ 的迭代器失效问题。作者指出,虽然代码表面上看似安全,但由于使用 std::make_pair 导致的拷贝操作,实际上破坏了迭代器的有效性。这种隐蔽的语义差异使得问题难以察觉,强调了 C++ 语言的复杂性和潜在风险。
本文讨论了Mooncake统一内存池中的驱逐策略,强调在处理softpin对象时,驱逐应以迁移为主,而非删除。借鉴Linux内存回收机制,提出分层的驱逐逻辑,以优化内存管理,确保在线操作的高效性和稳定性。
OpenClaw与Mooncake的整合显著提升了多会话推理的稳定性,降低了系统的尾部延迟,改善了用户体验,减少了卡顿现象。尽管请求速度没有显著提升,但系统的稳定性和响应性得到了改善,使得OpenClaw更适合处理复杂的多会话和长上下文交互。
本文讨论了在 Mooncake 接入 RL 中的 local master 和统一内存池设计,通过整合数据平面减少数据拷贝,提高效率。提出了统一的内存分配、元数据管理和生命周期管理,确保数据高效访问和管理。强调 AI 在代码实现中的辅助作用,认为 Rust 语言更适合此类开发。
Mooncake正式加入PyTorch生态系统,专注于开放治理和与PyTorch社区的长期合作。它提供高效的通信和存储基础设施,支持分散的LLM架构,提升推理性能。Mooncake的功能包括预填充与解码分离、全局KVCache重用、弹性专家并行和容错分布式后端,已被多家知名企业广泛采用。
Databricks收购Mooncake技术,旨在将分析直接融入决策过程。Mooncake支持PostgreSQL,结合事务处理与快速分析,消除ETL管道管理。其实时层和HTAP功能促进了事务与分析系统的整合,为AI代理提供新可能性。
Mooncake Labs加入Databricks,推动Lakebase发展,提供集成OLTP数据库,优化AI代理应用开发。Mooncake使开发者和代理能够在同一数据上实时进行事务和分析,提高效率。
Kimi与清华大学等机构联合开源了大模型推理架构Mooncake,旨在提升推理性能和用户体验。该架构采用分离式设计,优化资源利用,已在GitHub获得1.2k星。Mooncake通过预测负载和早期拒绝策略处理高并发请求,显著提高吞吐量,支持Kimi线上80%以上的流量。
2024年6月,Kimi与清华大学联合发布了以KVCache为核心的大模型推理架构Mooncake,旨在提升推理性能、降低成本并促进高性能推理框架的生态建设。该项目已开源,阿里云参与了关键组件的开发,未来将与更多机构合作推动模型推理系统的创新。
在大模型时代,推理系统面临高负载和成本挑战。月之暗面Kimi与清华大学联合发布的Mooncake推理系统,基于KVCache架构提升推理效率,并已开源,旨在为大模型提供高性能存储标准接口,推动行业发展。
完成下面两步后,将自动完成登录并继续当前操作。