小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
什么是数据转换?

数据转换是将原始数据清洗、过滤、聚合、连接和标准化为可用数据集的过程,对提升数据质量、支持决策和ETL流程至关重要。它涉及去重、精炼、集成等技术,可通过批处理或流式处理执行,工具选择包括云端、开源或低代码等。Databricks提供Spark声明式管道和Lakeflow Jobs等工具,简化ETL开发,确保数据质量,并支持实时或批量处理,助力企业高效利用数据。

什么是数据转换?

Databricks Databricks · 2026-09-03T19:54:00Z
把 RDS MySQL 数据入仓 Amazon Redshift 的三种方式 · 首推 Zero-ETL

本文介绍将RDS MySQL数据同步至Amazon Redshift的三种方式:S3+COPY批量加载、AWS Glue ETL微批处理、Zero-ETL近实时集成。重点推荐Zero-ETL,因其零代码、全托管、延迟约1分钟且支持完整CDC(含删除操作)。文章对比三种方案的架构、成本、运维和延迟,并提供选型建议:持续同步选Zero-ETL,复杂转换用Glue,一次性导入用S3+COPY。

把 RDS MySQL 数据入仓 Amazon Redshift 的三种方式 · 首推 Zero-ETL

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-08-28T15:36:18Z
使用声明式模式现代化Lakehouse中的SQL ETL

Databricks在SQL编辑器中引入声明式ETL,支持追加、CDC和批量覆盖三种模式,简化数据转换流程。用户可直接在SQL查询中定义流程,平台自动处理增量处理、调度和编排。CDC模式支持SCD类型1和2,REPLACE WHERE提升性能。用户可混合传统SQL与声明式操作,并借助Genie Code生成和优化流程。

使用声明式模式现代化Lakehouse中的SQL ETL

Databricks Databricks · 2026-08-25T15:00:00Z
新鲜上下文:变更数据捕获,而非批量ETL

本文探讨了变更数据捕获(CDC)如何解决AI代理因批量ETL导致的数据陈旧问题。通过实时监控数据库变更,CDC能将更新快速同步至代理上下文,将延迟从数小时降至秒级。文章引用加拿大航空聊天机器人错误案例,强调实时数据对代理准确性的重要性,并介绍Redis的CDC系统RDI,帮助代理基于最新数据行动,减少错误和商业风险。

新鲜上下文:变更数据捕获,而非批量ETL

Redis Blog Redis Blog · 2026-08-12T00:00:00Z
使用 Amazon Athena 分析 Kiro 团队用量报表:动态模型列的数据建模实践

本文介绍使用Amazon Athena分析Kiro团队用量报表的实践。针对CSV中动态模型列可能导致数据错位的问题,通过ETL将宽表转为长表,采用Parquet格式和Partition Projection建表,实现稳定查询。方案完全Serverless化,月成本低于1美元,并接入Amazon QuickSight构建看板,便于团队观测用量、治理额度。

使用 Amazon Athena 分析 Kiro 团队用量报表:动态模型列的数据建模实践

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-29T08:26:45Z
ETL管道手册:如何在Python中构建生产级数据管道

本教程指导构建一个Python ETL数据管道,从法国Hub'Eau API提取每日水位数据,经清洗转换后发布为公开数据集。核心设计包括:使用dataclass管理配置、幂等性和增量加载模式、优雅处理网络错误和类型转换、去重合并数据,最终通过Kaggle CLI自动发布。教程强调生产级管道的设计决策,并提供模拟数据测试和真实API切换方法。

ETL管道手册:如何在Python中构建生产级数据管道

freeCodeCamp.org freeCodeCamp.org · 2026-07-27T17:45:05Z
如果你的Cron任务调度器已不够用,该怎么办?

Cron适合简单任务,但复杂工作流有四大局限:依赖、失败处理、可见性和回填。工作流编排工具如Kestra通过YAML定义流程,支持任务依赖、重试、事件触发和回填。教程演示了用Kestra构建ETL流程,解决Cron的不足,提升自动化可靠性。

如果你的Cron任务调度器已不够用,该怎么办?

freeCodeCamp.org freeCodeCamp.org · 2026-07-24T20:38:36Z
Supabase Pipelines现已进入公开Alpha阶段

Supabase Pipelines进入公开alpha,新增自动检测并应用源表schema变更至目标端,提升初始同步速度,并开放ClickHouse、Snowflake、DuckLake目的地申请。该工具通过Rust编写的ETL,将Postgres数据近实时复制到BigQuery等分析系统,采用按管道和用量计费,目前仅支持BigQuery,持续优化性能与扩展目的地。

Supabase Pipelines现已进入公开Alpha阶段

Blog - Supabase Blog - Supabase · 2026-07-21T07:00:00Z
AWS Glue 3.0 到 5.0 版本升级实践:中国区大规模 ETL 平台的迁移方法论

本文分享了在AWS中国区将近70个Glue ETL作业从3.0版本升级至5.0版本的经验。升级后整体DPU消耗降低约30%,部分作业性能提升超过60%。文章讨论了升级评估、环境适配、分批部署及性能对比,强调架构优化的重要性,并建议优先重构设计缺陷导致高消耗的工作负载。

AWS Glue 3.0 到 5.0 版本升级实践:中国区大规模 ETL 平台的迁移方法论

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-07T08:00:43Z
Databricks ETL迁移决策框架

选择数据迁移工具时,应根据工作负载的复杂性选择合适的工具,如Lakehouse、Spark Declarative Pipelines或PySpark。迁移过程应逐步进行,首先评估现有数据仓库,选择低风险、高可见性的工作负载进行快速迁移,随后现代化和优化管道,最终整合冗余ETL流程。

Databricks ETL迁移决策框架

Databricks Databricks · 2026-06-26T20:20:00Z
构建SQL ETL管道:数据工程师的完整指南

本文介绍了构建生产级SQL ETL管道的步骤,包括数据提取、转换和加载。ETL管道是现代分析架构的基础,使用SQL可以提高团队协作和管道的可维护性。现代ETL需支持批处理和流处理,以满足实时数据需求。有效的ETL设计应关注数据治理、性能优化和业务结果对齐,确保数据质量和准确性。

构建SQL ETL管道:数据工程师的完整指南

Databricks Databricks · 2026-06-18T09:48:20Z
Databricks在2026年SIGMOD大会上

Databricks将在2026年SIGMOD大会上展示其在Spark声明式管道方面的创新,并获得荣誉提名。该公司专注于简化增量处理,提高ETL工作负载效率,尤其是在维护物化视图方面。Enzyme技术显著提升了性能,展示了在生产工作负载中有效维护物化视图的能力。

Databricks在2026年SIGMOD大会上

Databricks Databricks · 2026-05-29T18:28:00Z
宣布Lakebase变更数据馈送(CDF)

Lakebase推出了变更数据馈送(CDF),简化了从操作数据库到Lakehouse的数据提取过程。通过Unity Catalog管理,用户可以轻松启用CDF,提升数据治理和流通效率。这一新架构将操作数据库转变为Lakehouse的原生Bronze层,支持ETL和流式工作流,推动数据管理的开放性与高效性。

宣布Lakebase变更数据馈送(CDF)

Databricks Databricks · 2026-05-27T13:11:00Z
宣布Databricks分析工程师学习路径

Databricks推出新的分析工程师学习路径,帮助SQL从业者将原始数据转化为可治理的AI语义模型和指标视图。课程内容包括数据建模、ETL管道构建和业务指标定义,适合希望承担更多数据责任的从业者。学习路径包含多个实践课程,旨在提升分析工程技能,实现高效的数据分析和AI应用。

宣布Databricks分析工程师学习路径

Databricks Databricks · 2026-05-18T14:46:06Z
发现一个很有意思的 .NET 8 开源项目:AI 工作流引擎 Slickflow

Slickflow 在 .NET 8 版本中进化为 AI 驱动的工作流编排平台,集成了大语言模型和知识增强能力,支持代码优先的自动执行,适合 ETL 和微服务场景,同时保留传统 BPM 功能,满足企业级流程控制需求。它重新定义了工作流引擎的边界,适合构建 AI 工作流和复杂业务流。

发现一个很有意思的 .NET 8 开源项目:AI 工作流引擎 Slickflow

dotNET跨平台 dotNET跨平台 · 2026-05-12T23:58:54Z
实时更新还是ETL?如何选择合适的工具

Supabase Realtime和ETL都能从Postgres数据库读取变化,但用途不同。Realtime用于实时更新用户界面,适合聊天和协作编辑;ETL则用于将数据可靠地移动到分析系统,适合数据仓库和报告。选择不当的工具可能导致数据丢失或延迟。

实时更新还是ETL?如何选择合适的工具

Blog - Supabase Blog - Supabase · 2026-05-05T07:00:00Z
重新思考现代数据平台的SQL ETL

SQL ETL实施面临碎片化挑战,导致操作复杂且难以扩展。Databricks通过统一平台整合执行、调度和监控,简化数据管道管理,提升性能和可靠性,支持多种工作流,确保团队高效协作,适应未来需求。

重新思考现代数据平台的SQL ETL

Databricks Databricks · 2026-04-29T16:45:00Z
数据工程师和数据科学家的AI数据转换指南

AI数据转换利用人工智能和机器学习自动化原始数据的清洗和结构化,提升数据质量和可用性。有效的数据转换确保数据在分析和模型训练前得到清理和规范。ETL和ELT是主要的数据转换模式,其中ELT在云环境中更具可扩展性。最佳实践包括版本控制转换脚本、记录数据清洗规则、自动化测试和早期参与数据科学家。高质量的数据基础和人工审核AI生成的代码是数据驱动组织的关键。

数据工程师和数据科学家的AI数据转换指南

Databricks Databricks · 2026-04-21T11:39:52Z
开放平台,统一管道:为何在Databricks上使用dbt能够加速数据转型

dbt在Databricks平台上运行,整合数据转型工作流,提供开放存储和统一治理。通过Unity Catalog,团队高效管理数据权限和访问,简化操作复杂性。Databricks的高性能引擎提升ETL工作负载效率,减少手动调优需求,帮助用户专注于构建数据管道。

开放平台,统一管道:为何在Databricks上使用dbt能够加速数据转型

Databricks Databricks · 2026-04-16T18:07:43Z

管道与过滤器架构模式将复杂处理分解为独立阶段,通过标准化通道传递数据。起源于1960年代的Unix,强调每个过滤器只关注输入和输出,促进了系统的独立开发与测试。本文探讨了Unix管道的历史、形式化定义、设计模式及其在ETL和流处理中的应用,展示了管道模式的灵活性与高效性。

【系统架构设计】管道与过滤器是什么:Unix 哲学的架构表达

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-13T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码