CloudJump III Optimizing Cloud Databases for Tiered Storage(SIGMOD 2026)

💡 原文中文,约6900字,阅读约需17分钟。
📝

内容提要

CloudJump III 提出引擎集成分层存储方案,将数据放置决策融入存储引擎,利用页类型、存活时间等元信息优化冷热数据分布。通过BPE缓存准入策略、OSS Buffer写合并及快照版本协议,实现性能稳定、成本优化和零停机备份,显著提升单位成本性能。

🔎

延伸解读

为何内核外分层会误判热数据

文章指出,基于IO trace的外部分层方案(如dm-cache、ILM/HSM)无法感知存储引擎内部状态,导致最热的页面因常驻DRAM而显得“冷”,索引页和元数据页可能被过早降级。这种系统性误判会引发召回风暴和性能抖动,说明分层决策必须依赖引擎可见的元信息(如页类型、存活时间)才能准确识别冷热。

BPE准入策略的工程价值

CloudJump III的BPE采用基于ghost链表的准入控制,只有被二次访问的页才能进入SSD缓存,有效过滤一次性页。消融实验显示,相比全量准入,该策略使TPS提升12%,命中率从63.4%升至72.7%,同时BPE的IOPS下降约91%,显著减少SSD写放大和磨损。这体现了选择性准入在缓存管理中的实际收益。

快照版本协议如何保障零停机备份

分层存储下,备份正确性依赖版本协同。CloudJump III通过全局快照版本号,使OSS写入携带版本,修改对象生成新版本,旧版本保留给备份。备份采用lock-version-copy流程,利用OSS fast-copy实现秒级快照(0.64秒),接近纯ESSD的0.52秒,远快于纯OSS的53.73秒,且不增加恢复开销。

部署经验:快层应共享而非专属

作者强调,按表刚性划分快层容量会导致利用低效和性能不稳定。CloudJump III将快层视为全局共享缓存,通过统一淘汰和配额策略动态分配容量,逻辑归属与物理放置解耦。此外,eviction-centric设计优于主动迁移,避免额外锁层级和带宽争抢,简化恢复逻辑,降低运维复杂性。

🏷️

标签

➡️

继续阅读