CloudJump III Optimizing Cloud Databases for Tiered Storage(SIGMOD 2026)
内容提要
CloudJump III 提出引擎集成分层存储方案,将数据放置决策融入存储引擎,利用页类型、存活时间等元信息优化冷热数据分布。通过BPE缓存准入策略、OSS Buffer写合并及快照版本协议,实现性能稳定、成本优化和零停机备份,显著提升单位成本性能。
延伸解读
为何内核外分层会误判热数据
文章指出,基于IO trace的外部分层方案(如dm-cache、ILM/HSM)无法感知存储引擎内部状态,导致最热的页面因常驻DRAM而显得“冷”,索引页和元数据页可能被过早降级。这种系统性误判会引发召回风暴和性能抖动,说明分层决策必须依赖引擎可见的元信息(如页类型、存活时间)才能准确识别冷热。
BPE准入策略的工程价值
CloudJump III的BPE采用基于ghost链表的准入控制,只有被二次访问的页才能进入SSD缓存,有效过滤一次性页。消融实验显示,相比全量准入,该策略使TPS提升12%,命中率从63.4%升至72.7%,同时BPE的IOPS下降约91%,显著减少SSD写放大和磨损。这体现了选择性准入在缓存管理中的实际收益。
快照版本协议如何保障零停机备份
分层存储下,备份正确性依赖版本协同。CloudJump III通过全局快照版本号,使OSS写入携带版本,修改对象生成新版本,旧版本保留给备份。备份采用lock-version-copy流程,利用OSS fast-copy实现秒级快照(0.64秒),接近纯ESSD的0.52秒,远快于纯OSS的53.73秒,且不增加恢复开销。
部署经验:快层应共享而非专属
作者强调,按表刚性划分快层容量会导致利用低效和性能不稳定。CloudJump III将快层视为全局共享缓存,通过统一淘汰和配额策略动态分配容量,逻辑归属与物理放置解耦。此外,eviction-centric设计优于主动迁移,避免额外锁层级和带宽争抢,简化恢复逻辑,降低运维复杂性。