Databricks将在VLDB 2026展示多项创新,包括Reynold Xin的主题演讲,介绍AI代理时代数据库工程的“第三黄金时代”,提出Lakebase和LTAP新范式。四篇论文涵盖Lakebase架构、Spark Structured Streaming演进、AutoLiquid自动数据布局优化及Ultron历史查询优化,另有Enzyme演示,旨在提升湖仓性能与实时分析能力。
DuckLake是一种基于DuckDB扩展的湖仓格式,将元数据与数据分离:目录(本地文件或PostgreSQL)存储表结构、快照和文件指针,Parquet文件存储实际数据。支持本地运行及PostgreSQL+MinIO生产部署,通过分区将文件组织在S3中。查询时利用目录中的列统计进行分区剪枝和谓词下推,可跳过无关文件,显著提升查询效率。
本文介绍将传统数据仓库中的存储过程迁移至Databricks湖仓的方法。通过示例展示游标、临时表、事务等SQL脚本的翻译过程,保留原业务逻辑,无需重写为Python或Spark。迁移后由Unity Catalog管理,支持访问控制和血缘追踪,并发处理更高效,迁移时间可减少50-75%。
Unity Catalog现已进入公共预览阶段,支持外部引擎访问管理的Delta表。企业可以在统一治理下灵活使用多种引擎,享受性能优化和成本节约。通过开放API,外部引擎如Starburst和DuckDB可直接与Unity Catalog集成,实现数据的创建、读取和写入。这提升了数据治理和跨引擎的互操作性,确保了数据访问的安全性和一致性。
本文总结了RocksDB的内核机制,探讨了存储引擎的选择决策树,包括OLTP、OLAP和湖仓等场景。RocksDB适合写密集型负载,适用于Flink、TiKV等嵌入式应用。文章对比了RocksDB与InnoDB、列存和湖仓的特点,指出各自的适用场景和优化方向,并提供了存储栈和数据平台的阅读地图,以帮助读者理解不同存储引擎的关系与应用。
在专业篮球比赛中,Hawk-Eye摄像头每秒生成大量数据,帮助球队分析运动员表现和预防伤病。Databricks数据智能平台整合多种数据源,提升决策效率,支持教练和管理层实时获取关键分析,推动运动员健康和比赛胜利。
Databricks推出了针对Google Sheets的连接器,使用户能够直接在Sheets中访问实时的Databricks数据,从而提升决策效率并减少数据孤岛。Nubank利用该连接器增强数据文化,支持非技术用户进行数据探索,推动数据驱动决策。
Databricks的Iceberg v3进入公测,支持增量数据处理和半结构化数据分析,简化数据管道。新特性包括行血统、删除向量和VARIANT类型,提升性能,支持多引擎互操作性,优化数据治理,降低维护成本。
汽车服务组织面临压力,通话量上升,电动车增加了诊断复杂性。马自达通过Databricks整合数据,提高服务代理效率,采用统一目录和多语言能力,确保数据安全高效访问。通过反馈驱动的迭代和评估,马自达提升了服务质量和响应速度。
pg_duckpipe是一个新的PostgreSQL扩展,能够实时将常规堆表同步到DuckLake列式表。它通过基于WAL的CDC实现,无需外部基础设施,用户只需一个SQL调用即可开始同步,解决了数据过时和维护复杂性的问题。该扩展支持从远程PostgreSQL实例复制数据,简化了分析层的添加,正在积极开发中,未来将增加更多功能和性能优化。
Databricks SQL(DBSQL)解决了传统数据仓库速度慢、成本高的问题,平均速度提升5倍,支持无服务器运行和开放标准。2025年,DBSQL将引入自动性能管理、AI功能和开放SQL特性,帮助团队更快分析和决策,降低迁移难度和成本。
数据仓库因其结构性受到重视,但许多人认为湖仓牺牲了这种纪律。本文揭示了关于Databricks的误区,强调其仍支持关系建模、主外键和约束。Databricks湖仓结合了数据仓库的可靠性与数据湖的灵活性,提供统一的平台,支持现代数据建模和数据质量管理。
11月20日,Elizabeth Christensen与我共同举办了第七届PostGIS日,庆祝PostGIS的成就。活动汇聚全球演讲者,讨论空间AI代理及其实际应用,展示PostGIS作为高性能连接器在现代地理空间基础设施中的重要作用。
Unity Catalog推出跨引擎细粒度访问控制,解决湖仓中不同引擎治理碎片化问题。用户可定义基于标签的行过滤和列掩码,确保数据治理政策在多个引擎中一致执行。这一创新支持在开放存储中灵活使用多种引擎,同时保障安全性和合规性。
Databricks在数据智能平台中支持Apache Iceberg v3,提供统一的数据层,提升性能和互操作性。新特性包括删除向量、行级血缘和变体数据类型,优化Iceberg工作负载。Unity Catalog实现Delta与Iceberg表的无缝互操作,促进开放标准,助力客户在湖仓基础上构建数据管理。
Databricks与Capital One合作,建立湖仓灾难恢复服务。在一次供应商故障中,Capital One迅速转移分析工作,展示了强大的数据平台和灾难恢复策略的重要性。现代开放数据湖仓需具备高韧性,以应对区域故障,确保关键分析持续运行。
新SET MANAGED命令简化了将UC外部表转换为UC管理表的过程,减少停机时间,支持并发写入,并保留表配置和历史。使用Unity Catalog作为数据源,管理表提升性能和治理,支持自动优化和数据清理。转换步骤包括选择外部表、检查准备情况、执行转换命令及验证结果。
Lakebase是Databricks推出的新工具,简化了反向ETL过程,能够将高质量数据从湖仓直接同步到应用程序,解决低延迟和复杂管道问题,支持实时决策和个性化体验,提高数据管理效率。
Redpanda 提供灵活的多云解决方案,支持多种部署方式。Iceberg Topics 与 Databricks 集成,简化实时数据分析,确保 Kafka 兼容性。统一管理使用户高效处理数据,降低运营成本,提升体验。
文章介绍了Timescale Cloud,这是一种专注于时间序列数据的可靠PostgreSQL云服务,提供快速处理和实时分析。它通过支持服务、开源扩展和工具,提升PostgreSQL性能,以满足企业对安全性和可靠性的需求。
完成下面两步后,将自动完成登录并继续当前操作。