Databricks Runtime 14.3引入了State Reader API,允许用户访问和分析Structured Streaming的内部状态数据。该API有助于开发、调试和故障排除有状态的Structured Streaming工作负载。它包括两个新的DataFrame格式选项:state-metadata和statestore。State Reader API简化了有状态流应用程序的开发和调试,提供了并行性和偏斜度的洞察,并帮助调查生产问题。该API已包含在Apache Spark 4.0.0中。
Apache Spark™ Structured Streaming是一种流处理平台,构建在Spark SQL引擎之上,提供可扩展性和容错性。Databricks上的Structured Streaming使用率呈指数增长,每周运行超过1400万个作业。Structured Streaming工作负载分为分析和操作两类,操作工作负载强调对数据的及时转换和操作。Databricks的性能改进提高了有状态流水线的延迟,为具有严格延迟SLA的工作负载提供了更好的支持。
本文介绍了Apache Spark Structured Streaming的性能提升计划,通过改进offset管理来降低处理延迟。经过评估,这些改进使延迟提高了68-75%,即从700-900毫秒降至150-250毫秒。本文还介绍了异步进度跟踪和异步日志清理等性能改进的详细信息,并提供了性能基准测试结果。
Azure、AWS和GCP现已正式推出支持使用Delta Sharing的Structured Streaming功能,数据提供者可以利用这一功能轻松扩展其数据服务,数据接收者可以从共享数据集中流式传输最新更改,降低处理大批量数据的基础设施成本。本文将介绍如何利用Structured Streaming和Delta Sharing来最大化数据的商业价值,并探讨如何使用Databricks Workflows等其他功能来构建实时数据应用程序。
完成下面两步后,将自动完成登录并继续当前操作。