Amazon S3表类数据存储服务现已支持Apache Iceberg V3全部数据类型,包括变体、纳秒时间戳、几何、地理位置和未知类型,以及删除向量和行谱系。用户可新建V3表或从V2升级,升级不可逆。V3以删除向量替代位置删除文件,提升行级操作效率,并原生支持半结构化和地理空间数据。新数据类型需Spark 4.0以上引擎,且仅支持Parquet格式。该功能已在所有支持区域推出,不额外收费。
Apache Iceberg v3 引入了删除向量、行谱系和新数据类型,提升了数据处理和查询效率。新格式优化了行级删除,减少写放大,改善读取性能。行谱系简化了增量处理,支持灵活的数据更新。新数据类型增强了半结构化和地理空间数据的存储与查询能力,促进了不同湖仓格式间的互操作性。
Databricks推出公共预览版的Predictive I/O for Updates,可提供高达10倍的MERGE、UPDATE和DELETE查询性能。该功能使用删除向量来最小化读取开销并优化写入性能,使用学习和启发式方法来智能应用删除向量,不影响读取查询性能。Predictive I/O for Updates可用于Databricks SQL Pro和Serverless,可显著加速ETL管道或CDC摄取作业的执行。
完成下面两步后,将自动完成登录并继续当前操作。