内容提要
AWS Glue 6.0发布,价格降低30%,全面支持Apache Iceberg v3,基于Spark 4.1、Python 3.12构建。新增VARIANT数据类型、几何地理类型、纳秒时间戳等功能,提升半结构化数据处理和PySpark性能,支持毫秒级实时流处理。用户可通过现有API或控制台直接使用,无需更改代码。
延伸解读
价格降低与迁移成本
AWS Glue 6.0 价格比之前版本降低 30%,但迁移现有作业时需注意:虽然无需更改 API,但基于 Spark 4.1 和 Python 3.12 的运行时升级可能带来兼容性问题。建议使用 Spark 升级代理或自动升级功能,并参考官方迁移文档,以降低升级风险。
VARIANT 数据类型的实际价值
VARIANT 数据类型支持直接存储和查询 JSON、日志等半结构化数据,无需展平模式,可避免重复数据和自定义解析代码。这能显著提升查询性能,并减少模式变更时的管道中断,尤其适合大规模处理半结构化数据的场景。
实时流处理与性能提升
AWS Glue 6.0 引入实时流式传输模式,可实现毫秒级延迟,适用于实时事件处理和时间敏感数据路由。同时,Arrow 原生 Python UDF 和 UDTF 消除了 Python 与 JVM 间的序列化开销,提升了 PySpark 复杂转换的性能。
Q&A
AWS Glue 6.0 相比之前版本价格降低了多少?
AWS Glue 6.0 的价格比之前的 AWS Glue 版本降低了 30%。
AWS Glue 6.0 基于哪些主要组件构建?
AWS Glue 6.0 基于 Apache Spark 4.1、Python 3.12 和 Scala 2.13 构建。
AWS Glue 6.0 对 Apache Iceberg v3 的支持有何特点?
AWS Glue 6.0 提供了完整的 Apache Iceberg v3 规范,基于 Iceberg 1.11.0 构建,并新增了 VARIANT 数据类型、几何和地理数据类型、纳秒级时间戳以及未知类型处理等功能。
AWS Glue 6.0 中的 VARIANT 数据类型有什么作用?
VARIANT 数据类型支持数据粉碎,可以存储和查询 JSON、日志和事件数据,无需展平模式,从而避免重复数据、自定义解析代码以及模式变更时的数据管道中断,显著提升半结构化数据的查询读取性能。
AWS Glue 6.0 如何提升 PySpark 性能?
AWS Glue 6.0 引入了 Arrow 原生 Python UDF 和 UDTF,消除了 Python 和 JVM 之间的序列化开销,从而提高了 PySpark 在处理复杂转换时的性能。
AWS Glue 6.0 的实时流式传输模式有什么特点?
AWS Glue 6.0 的实时流式传输模式基于 Spark 4.1 的实时模式构建,并针对 Glue 进行了优化执行,可实现个位数毫秒级的延迟,支持实时事件处理、低延迟数据转换管道和时间敏感数据路由。
如何开始使用 AWS Glue 6.0?
您可以通过 AWS CLI、AWS SDK、AWS Glue Studio 等使用现有的 --glue-version 参数在 create-job 或 update-job API 中选择 Glue 6.0。在 AWS Glue Studio 控制台中,可以在作业详情选项卡中选择版本 Glue 6.0。对于交互式会话,可以在 %glue_version 魔法命令中设置 6.0。
AWS Glue 6.0 的定价模式是怎样的?
AWS Glue 6.0 按小时费率(按秒计)收费,适用于爬网程序和 ETL 任务。对于 AWS Glue Data Catalog,需要为元数据的存储和访问支付月度费用,前 100 万个对象的存储和前 100 万次访问免费。