Apache Iceberg 社区新增两项 REST Catalog 规范:读限制和目录标签。读限制允许目录将行、列过滤策略委托给受信引擎执行,适用于引擎直连目录场景;目录标签通过键值元数据在联邦目录间传递治理上下文(如 PII 标记),由消费方目录本地执行策略。两者分别解决委托执行与跨目录治理可移植性问题,是开放湖仓统一治理的重要进展。
pgColumnar发布第二个alpha版本,新增只读Apache Iceberg支持、S3对象存储读写、维护守护进程,并改进统计、规划器、性能与安全。原生格式不变,但需执行ALTER EXTENSION升级命令,否则读取旧表会报错。
Parquet是一种高效的列式二进制数据格式,比CSV更可靠,支持压缩和快速查询,被Spark、DuckDB等主流工具广泛支持。Apache Iceberg作为表格式管理Parquet文件集合,提供事务、模式演进和时间旅行功能。两者结合,可在低成本存储上实现数据仓库行为,适合数据超出单一系统时使用。
Apache Iceberg是ASF下的开源表格式项目,Google的三位工程师分享了他们的贡献。Talat Uyarer强调V4规范改进元数据、支持流式写入和细粒度访问控制;Ahmed Abualsaud开发Beam的IcebergIO多语言连接器,提升SQL集成;Parth Desai关注开放湖仓架构,支持AI和跨引擎互操作。开源协作推动项目发展。
Databricks推出OpenSharing,作为开源Delta Sharing协议的继任者,支持Apache Iceberg REST Catalog客户端,增强数据和AI资产的安全共享。OpenSharing允许组织通过标准API共享技能、模型和非结构化数据,提高数据共享的灵活性和安全性。
Unity Catalog 是一个全面的 Apache Iceberg 目录,具备开放 API、目录联合和跨引擎访问控制等功能。它支持多种引擎,确保数据治理和优化,帮助企业实现安全共享和高效管理,满足 AI 应用需求。同时,Unity Catalog 提供自动优化,提升查询性能,推动 Iceberg 和 Delta 的统一发展。
本月的Plus One强调了Apache Iceberg和Apache Geode的现代化进展,以及Apache STeVe v3的重建。ASF社区通过开放合作推动创新,庆祝多个项目周年,并欢迎新任执行副总裁Daniel Ruggeri。社区活动“Community Over Code Glasgow 2026”将于2026年10月举行,提供168个会议,促进跨项目合作与学习。TAC支持申请仍在进行中,帮助参与者覆盖旅行和注册费用。
Dipankar Mazumdar是Cloudera开发者关系总监,专注于湖屋架构和人工智能。他介绍了Apache Iceberg,这是一种高性能的开放表格式,旨在提高数据湖的可靠性和简便性。Iceberg解决了传统数据湖的更新不可靠和元数据处理成本高等问题。该项目于2018年开源,促进了社区合作与采用。未来,Iceberg将支持更多AI驱动的工作负载,关注灵活的数据表示和索引改进。
云数据分析平台如Databricks、Snowflake和BigQuery简化了数据平台的创建。本文介绍如何在开源数据湖堆栈上设置批量摄取层,确保用户拥有所有组件。重点在于建立可靠的数据摄取流程,使用Apache Airflow调度任务,并结合RustFS、Apache Iceberg和Project Nessie等技术,以实现高效的数据摄取和后续分析,确保数据的可靠性和可扩展性。
某跨境电商平台的数据团队面临批处理与实时处理数据不一致的问题。虽然Lambda架构理论上能解决此问题,但实际维护成本高且数据一致性难以保证。数据仓库、数据湖及Lambda/Kappa架构经历多次演变,最终发展为Lakehouse架构,结合了数据仓库的事务管理与数据湖的灵活性。Lakehouse通过Delta Lake和Apache Iceberg提供了更好的数据管理能力,解决了数据质量和一致性问题。
Apache Gluten和Apache Polaris已成为顶级项目,前者加速Apache Spark的SQL和DataFrame工作负载,后者为Apache Iceberg提供全面的目录服务。这标志着两个项目的成熟,ASF致力于支持开源社区的发展。
Delta Sharing是一个广泛采用的数据共享开放协议,支持Apache Iceberg格式。它允许数据提供者安全、实时地共享数据,打破平台壁垒,促进跨云协作。新功能简化了数据共享流程,增强了安全性和治理能力。
AWS对Amazon CloudWatch进行了重大增强,使其成为统一的可观察性平台,整合多账户环境中的操作、安全和合规日志。新功能支持Apache Iceberg兼容的日志查询,简化日志管理并降低成本。CloudWatch现支持多种第三方数据源,提供统一数据存储,用户可通过自然语言或流行查询语言进行查询。尽管面临竞争,其“零ETL”特性可能吸引AWS中心的组织。
亚马逊云科技推出Amazon S3 Tables,支持Apache Iceberg,优化大规模分析工作负载,提供高查询性能和事务处理能力,自动管理生命周期,支持行级事务、时间旅行和模式演进,兼容多种分析服务。
今天发布了iceberg-js,这是一个轻量级的JavaScript客户端,用于Apache Iceberg REST目录API,旨在帮助JavaScript和TypeScript开发者管理Iceberg表。iceberg-js是一个HTTP包装器,支持多种身份验证方法,兼容Node.js和现代浏览器。该库专注于目录管理,不支持数据操作或查询执行,鼓励与查询引擎配合使用。
Supabase推出了分析存储桶,专为分析工作负载设计,基于Apache Iceberg和Amazon S3。它以列式Parquet格式存储数据,优化查询和聚合,提供低成本存储、开放表格式和时间旅行功能,适合存储大量数据和进行重分析查询。用户可通过Supabase仪表板或SDK创建和管理存储桶,并与Postgres结合使用,实现数据的实时流转和历史查询。
开放治理时代已来临,Unity Catalog(UC)作为互操作治理的基础,已被700多家企业采用。UC通过开放API简化外部工具连接,支持Delta Lake和Apache Iceberg,提供统一访问控制和高性能查询,证明了开放与治理结合能有效促进互操作性。
Databricks在数据智能平台中支持Apache Iceberg v3,提供统一的数据层,提升性能和互操作性。新特性包括删除向量、行级血缘和变体数据类型,优化Iceberg工作负载。Unity Catalog实现Delta与Iceberg表的无缝互操作,促进开放标准,助力客户在湖仓基础上构建数据管理。
在数字化转型中,企业面临数据激增。Apache Iceberg作为开源数据湖格式,提供高效存储解决方案。亚马逊云科技的S3 Tables增强了Iceberg的托管能力,简化数据管理。通过SeaTunnel,企业可实现实时与批量数据集成,提升数据湖的灵活性和性能。
本周活动包括Miles Richardson在伦敦的Apache Iceberg社区会议上介绍WarehousePG项目,以及PGDay UK和PGDay Lowlands等会议,讨论PostgreSQL的挑战和性能调优等主题。
完成下面两步后,将自动完成登录并继续当前操作。