Spark 4.1增强了Spark Connect的稳定性和可扩展性,支持Python客户端的Spark ML,优化了模型缓存,提升机器学习性能。SQL功能扩展,支持复杂数据处理和递归CTE,新增VARIANT数据类型,提升读取性能,整体改善开发者体验,感谢社区贡献。
Posit和Databricks合作,提供简化的用户体验,使用RStudio Desktop和Databricks Lakehouse分析数据。合作旨在通过sparklyr改进对Spark Connect的支持,并自动化未来的许多步骤。用户只需设置环境变量和安装所需的软件包即可连接RStudio和Databricks。连接后,用户可以使用dbplyr和dplyr函数访问和分析数据。文章提供了使用这些工具分析纽约市出租车行程数据的示例。
Apache SparkTM 3.4发布了Spark Connect,允许用户直接连接IDE、笔记本和现代数据应用程序到Spark集群。Spark Connect引入了解耦的客户端-服务器架构,使任何应用程序都能远程连接到Spark集群。它提高了稳定性、升级、调试和可观察性。Spark Connect客户端库旨在简化Spark应用程序开发。它是一个可以嵌入到任何地方的轻量级API。Databricks Connect现在基于开源Spark Connect构建。Spark Connect支持大多数PySpark和Scala API。流支持即将推出。Spark Connect使访问Spark变得无处不在。
Databricks Connect "v2"现已公开预览,允许开发人员从任何应用程序远程连接到Databricks。它基于开源Spark Connect构建,可从任何IDE进行交互式开发和调试。Databricks VS Code扩展程序使用Databricks Connect进行内置调试,合作伙伴可以轻松地将库嵌入其产品中以进行深度集成。只需几行代码,就可以在Databricks之上构建交互式数据应用程序。Databricks Connect "v2"简化并改进了数据工程师和科学家与其Databricks环境的交互。该库今天可供下载。
Apache Spark 3.4发布了许多新功能,包括Spark Connect、PyTorch分布式训练、改进的SQL功能和流媒体改进。此外,还包括Python任意状态处理和Protobuf支持。该版本强调易用性、稳定性和精细化,解决了大约2600个问题。超过270个贡献者为此做出了贡献。用户可以通过注册免费的Databricks Community Edition或Databricks Trial轻松地尝试Apache Spark 3.4。
完成下面两步后,将自动完成登录并继续当前操作。