40年数据库规则被AI代理打破:LTAP如何统一OLTP与OLAP工作负载

40年数据库规则被AI代理打破:LTAP如何统一OLTP与OLAP工作负载

💡 原文英文,约1900词,阅读约需7分钟。
📝

内容提要

Databricks高级产品经理Jonathan Katz指出,AI代理正打破运营与分析数据间的传统壁垒。LTAP通过统一存储层,让分析查询直接作用于实时运营数据,无需复制或迁移。它利用无状态计算与列式格式,避免HTAP的高成本,支持独立扩展。此架构简化了欺诈检测等实时工作流,减少延迟,并统一数据治理,使数据更易被代理高效利用。

🔎

延伸解读

LTAP与HTAP的本质区别

LTAP并非HTAP的简单升级,而是将统一放在存储层而非引擎层。HTAP试图让一个引擎同时高效处理事务与分析,成本高且难以扩展。LTAP则保持事务与分析引擎分离,各自独立扩展,仅在存储层统一数据格式,从而降低计算成本,提升灵活性。

AI代理为何打破传统数据壁垒

AI代理需要实时访问运营数据以做出即时决策,如欺诈检测。传统批处理复制导致数据延迟,无法满足毫秒级响应。同时,代理的查询可能给运营系统带来沉重负担。LTAP通过统一存储,让分析查询直接作用于实时数据,避免复制,同时减轻对事务系统的压力。

LTAP的存储架构与数据一致性

LTAP采用双层存储:热层保留行格式以支持快速事务,冷层使用列式格式优化分析。关键在于确保数据在转换时保持物理表示不变,避免位级差异。这种设计使得同一份数据既能高效服务事务,又能直接用于分析,无需额外复制。

统一治理与开放生态的价值

LTAP将运营数据纳入统一数据目录,实现一致的访问控制和治理策略,避免数据孤岛。基于开放格式(如Iceberg、Delta)和Postgres生态,LTAP支持数据可移植性,让引擎适配数据而非相反,降低锁定风险,提升灵活性。

Q&A

为什么AI代理会打破运营数据和分析数据之间的传统壁垒?

AI代理需要实时访问运营数据来做出快速决策,例如欺诈检测必须在几百毫秒内完成。传统上,分析查询需要将数据复制到分析系统中,导致延迟,无法满足代理的实时性要求。因此,代理需要直接查询运营数据,但运营系统无法承受分析查询的负载,这促使了LTAP等新架构的出现。

LTAP是什么?它是如何工作的?

LTAP(Lake Transactional/Analytical Processing)是一种统一存储层架构,允许分析查询直接作用于实时运营数据,无需复制或迁移。它通过将事务和分析数据存储在单一逻辑存储层中,利用无状态计算和列式格式,实现高性能分析读取,同时不影响事务处理。存储层分为热层(行格式)和冷层(列格式),分别优化运营和分析工作负载。

LTAP与HTAP相比有什么优势?

HTAP系统虽然能处理实时分析,但成本高、运行复杂且通常不开放。LTAP通过统一存储层,将运营和分析计算分离为独立的无状态服务,允许独立扩展和按需付费,避免了HTAP的高成本和复杂性。存储是廉价的,计算是昂贵的,LTAP让用户只为实际使用的计算付费,而不是为一个试图同时处理两种工作负载的昂贵系统付费。

在欺诈检测等场景中,传统架构如何导致问题?LTAP如何解决?

在欺诈检测中,信用卡交易在几百毫秒内完成,如果代理基于批量复制的数据(延迟几分钟或几小时)工作,就无法及时阻止欺诈。直接查询运营系统又会因分析查询的负载而降低事务性能。LTAP允许代理直接查询实时运营数据,同时通过列式格式和独立计算避免对事务系统的影响,从而减少延迟并提高检测效率。

LTAP如何统一数据治理?

LTAP将所有数据(运营和分析)存储在统一的存储模型中,并纳入同一个数据目录(catalog)。这使得数据治理策略(如访问控制、安全策略)可以一致地应用于所有数据,避免了传统架构中运营数据在复制到分析系统后脱离治理边界的问题。

LTAP为什么需要建立在开放的基础上?

LTAP建立在开放格式(如Iceberg、Delta)和开源技术之上,确保数据的可移植性和灵活性。用户不必被锁定在特定数据库系统中,可以自由选择最适合的引擎来处理数据。开放基础也促进了生态系统的创新和协作。

LTAP的核心转变是什么?

LTAP的核心转变是统一存储:将运营和分析数据表示在同一个存储层中,无需移动或复制数据,即可让不同引擎直接访问。这消除了传统上为分析而复制数据的管道和延迟,使数据在写入后即可被分析,简化了数据架构。

🏷️

标签

➡️

继续阅读