MLflow是一个开源平台,用于管理机器学习生命周期,支持实验跟踪、模型部署和集中模型注册。其主要功能包括记录参数、指标和模型,自动记录、模型版本管理,简化机器学习流程,促进团队协作与模型优化。
在DE Zoomcamp 2025项目中,我构建了一个批量数据管道,处理超过110万条纽约Citi Bike骑行数据,旨在分析城市出行趋势和骑行行为,以支持共享单车运营和城市规划。该项目使用GCP、Airflow和dbt等工具,实现数据处理和可视化的自动化,揭示骑行模式和用户行为的洞察。
本文讨论了OLAP与OLTP的区别,以及Google BigQuery的特点。OLTP用于实时交易,OLAP用于数据分析。BigQuery是无服务器的数据仓库,支持按需计费和内置机器学习。优化查询需利用分区和聚类,以减少不必要的查询和数据加载,数据结构和查询优化对数据工程师至关重要。
本周我深入学习了Kestra工作流编排,尽管一开始与疟疾作斗争,但最终坚持下来。Kestra是一个开源的事件驱动编排平台,简化了工作流构建。我通过Docker Compose搭建了Kestra服务器和Postgres数据库,并构建了纽约出租车数据的ETL管道。Kestra的调度和数据回填功能便捷,YAML配置简单。我还尝试了dbt进行数据转换,并将ETL管道迁移到Google Cloud Platform。这一周收获颇丰,期待后续学习。
今年,我的目标是提升数据工程领域的专业技能。我参加了DataTalk的免费九周ZoomCamp,学习了Docker、Docker Compose和Terraform,实践了PostgreSQL数据库和云资源自动化设置。接下来将深入研究数据管道和工作流编排。
Docker是一个适合数据工程师的软件交付平台,提供隔离环境,确保环境一致性,便于本地实验和集成测试。Docker容器支持数据库和数据管道,具备可移植性和可扩展性,帮助用户快速构建和管理应用,避免“在我机器上能运行”的问题。
该课程包含6个模块和2个研讨会,重点讲解数据工程的核心主题,使用Slack和GitHub进行互动。内容涵盖环境设置、工作流编排、数据仓库、数据转换、批处理和实时数据处理。学员需完成综合数据工程项目以获得证书。
数据工程Zoomcamp第四版介绍了课程结构、团队及学习工具,涵盖Docker、Google Cloud、工作流编排、数据仓库、分析工程和流处理等模块。强调社区学习和项目实践,适合初学者,鼓励分享进展以建立个人品牌。
完成下面两步后,将自动完成登录并继续当前操作。