为AI时代而构建:VLDB 2026上的Lakebase、流处理与湖仓创新

为AI时代而构建:VLDB 2026上的Lakebase、流处理与湖仓创新

💡 原文英文,约800词,阅读约需3分钟。
📝

内容提要

Databricks将在VLDB 2026展示多项创新,包括Reynold Xin的主题演讲,介绍AI代理时代数据库工程的“第三黄金时代”,提出Lakebase和LTAP新范式。四篇论文涵盖Lakebase架构、Spark Structured Streaming演进、AutoLiquid自动数据布局优化及Ultron历史查询优化,另有Enzyme演示,旨在提升湖仓性能与实时分析能力。

🔎

延伸解读

AI代理如何重塑数据库需求

文章指出,AI代理工作负载带来数百万个短期、深度分支的数据库,传统OLTP引擎难以应对。这解释了为何Databricks推出Lakebase,通过存储与计算分离、支持Git式分支,满足代理的独特需求。读者可关注这一趋势对数据库设计的影响。

湖仓优化的自动化与历史利用

AutoLiquid和Ultron展示了自动化与历史数据在优化中的价值。AutoLiquid通过CLUSTER BY AUTO自动选择聚类键,在95%以上工作负载中优于人工选择;Ultron利用查询历史优化连接操作,将中位连接延迟降低25%。这提示读者,自动化优化和基于历史的调优是提升湖仓性能的关键方向。

LTAP:湖仓与事务处理的融合

文章提出LTAP(湖事务分析处理)新范式,旨在统一事务与分析处理。Lakebase和LakehouseRT的结合为实现LTAP奠定基础,支持对实时事务数据的低延迟分析。这标志着数据库架构向第三代演进,读者可关注其对实时分析场景的潜在影响。

Q&A

Databricks在VLDB 2026上提出了哪些新范式?

Databricks在VLDB 2026上提出了两个新范式:Lakebase和LTAP。Lakebase将存储和计算分离应用于OLTP数据库,而LTAP(Lake Transactional Analytical Processing)统一了事务处理和分析处理。

Lakebase是什么?它如何满足AI代理工作负载的需求?

Lakebase是第三代云数据库架构,它将无服务器PostgreSQL计算与存储解耦,将数据和预写日志直接以开放格式持久化到云对象存储中。它通过写时复制分支支持类似Git的数据库工作流,提供亚秒级冷启动,并支持对实时事务数据的低延迟分析,从而满足AI代理工作负载中数百万个短期、深度分支数据库的需求。

Apache Spark Structured Streaming在架构上做了哪些演进?

Structured Streaming的架构演进包括:微批处理流水线将吞吐量提高了3倍,新的有状态API简化了复杂业务逻辑的表达,并支持细粒度访问控制。

AutoLiquid是什么?它如何自动优化数据布局?

AutoLiquid是Databricks湖仓的自动数据布局优化系统,通过简单的CLUSTER BY AUTO原语自动化聚类键选择和验证。它结合启发式键选择和高效的影子验证,能够自动聚类数百万张表,并在超过95%的评估工作负载上优于客户选择的键。

Ultron是什么?它如何提升查询性能?

Ultron是一个基于历史的查询优化框架,利用分析工作负载的重复性来改进优化器决策,例如选择连接操作符类型。它通过高效存储历史和管理查询日志,显著提升了生产工作负载的性能,将中位连接延迟降低了25%。

Enzyme在VLDB 2026上展示了什么?

Enzyme是Databricks的增量视图维护引擎,用于数据工程工作负载。在VLDB 2026上,Yuhong Chen将演示Enzyme如何增量维护物化视图。

LakehouseRT是什么?它与LTAP有什么关系?

LakehouseRT是Databricks推出的实时低延迟分析引擎,由新的Reyden引擎驱动,直接基于开放湖存储。Lakebase和LakehouseRT的结合为交付首个真正的LTAP(Lake Transactional Analytical Processing)系统奠定了基础。

🏷️

标签

➡️

继续阅读