内容提要
Databricks宣布其平台上现已支持Ray。Ray已作为机器学习运行时的一部分,无需额外安装即可启动Ray集群。Ray与Databricks的集成实现了逻辑并行和数据并行的协同生态系统。它还实现了Spark和Ray之间的直接内存数据传输,消除了中间存储的需求。该集成为强化学习、分布式自定义Python应用程序、深度学习训练、高性能计算等各种应用打开了大门。在Databricks上启动Ray集群简单易行,并与其他Databricks功能无缝集成。Ray和Databricks的合作为AI开发需求提供了强大的解决方案,将计算效率和灵活性与Databricks平台的功能相结合。
延伸解读
从预览到正式发布:Ray在Databricks的成熟之路
Ray在Databricks上从公开预览到正式发布,期间已有数百家客户将其用于多模型分层预测、大语言模型微调和强化学习等场景。正式发布意味着Ray从15.0版本起成为机器学习运行时的内置组件,用户无需额外安装即可启动Ray集群,这降低了使用门槛,也表明该集成已通过生产环境验证,具备稳定性和可靠性。
Spark与Ray的协同:内存直传消除数据搬运瓶颈
传统上,在Spark和Ray之间转移数据需要经过昂贵的写读周期,而Databricks实现了两者之间的直接内存数据传输,省去了中间存储和翻译过程。这使得数据可以在Spark中高效处理,然后无缝传递给Ray,而无需离开Databricks环境。这种互操作性尤其有利于需要结合Spark数据并行和Ray逻辑并行的混合工作负载。
企业级功能与治理:MLflow、Unity Catalog和模型服务
Ray与Databricks的集成不仅限于计算,还深度整合了MLflow、Unity Catalog和模型服务。MLflow管理模型生命周期,Unity Catalog提供数据治理和血缘追踪,模型服务简化部署。三者结合使数据科学家能在统一平台内监控实验、管理版本并部署模型,同时确保数据质量和合规性,适合在受监管环境中协作。
客户实践:性能提升与成本效益
Marks & Spencer利用Ray on Databricks构建了从模型调优、训练到预测的生产就绪管道,结合了Spark的可扩展数据处理和Ray的可扩展机器学习工作负载。Cummins则报告称,使用Ray集群后处理时间至少减半,有时提升超过4倍,且没有额外成本。Ray Dashboard还帮助监控内存消耗,优化配置。这些案例展示了该集成在实际生产中的价值。
Q&A
Ray在Databricks上的集成有什么优势?
Ray与Databricks的集成实现了逻辑并行和数据并行的协同生态系统,支持高效的数据处理和无缝的数据传输。
如何在Databricks上启动Ray集群?
在Databricks上启动Ray集群非常简单,只需几行代码即可实现,Ray从版本15.0开始预安装在机器学习运行时中。
Ray在Databricks上支持哪些应用场景?
Ray在Databricks上支持强化学习、分布式自定义Python应用、深度学习训练和高性能计算等多种应用。
Ray与Spark之间的数据传输有什么特点?
Ray与Spark之间实现了直接内存数据传输,消除了中间存储的需求,提高了数据处理效率。
Databricks如何增强数据科学工作流程?
Databricks通过将Ray与MLflow、Unity Catalog和模型服务集成,简化了机器学习模型的跟踪、优化和部署。
Ray的使用对性能有什么影响?
使用Ray后,应用的处理速度显著提高,有些情况下处理时间减少了至少一半,甚至达到4倍的提升。