小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Prefect刚刚收购了Dagster,这又是一个大型的Airflow竞争对手——这并不是一个数据管道的故事

Prefect宣布收购Dagster,旨在整合两个主要的开源数据管道工具,以提升AI代理工作流的可靠性与规模。收购后,双方将继续保持各自品牌与产品路线,预计将推动数据生态系统的发展。

Prefect刚刚收购了Dagster,这又是一个大型的Airflow竞争对手——这并不是一个数据管道的故事

The New Stack
The New Stack · 2026-07-13T22:08:55Z
“沉默幻觉”循环:我们的自主数据管道如何毒化了自己的向量存储

文章讨论了在构建可靠AI系统时,处理金融报告PDF所面临的问题。由于自动化数据提取错误,导致信息不准确。为了解决这一问题,团队重新设计了数据管道,采用确定性检查,以确保数据的准确性和完整性,从而提高系统的可靠性并降低成本。

“沉默幻觉”循环:我们的自主数据管道如何毒化了自己的向量存储

The New Stack
The New Stack · 2026-07-09T13:00:00Z

该招聘信息要求候选人熟悉Rust和精通Python,具备编译原理和数据仓库的理解。职位涉及交易链路工具开发,包括数据管道、消息总线扩展、风险控制工具和执行算法。薪资范围为每月5000至10000美元,提供项目奖金,工作地点在香港或远程。

寻找执行系统开发工程师,专注于交易基础设施/执行系统

Rust.cc
Rust.cc · 2026-07-04T08:18:14Z
大金应用美洲公司如何利用Genie Code构建一致性的数据管道

大金应用美洲公司通过结构化操作模型和AI辅助的Genie Code,加速了数据管道的开发。团队采用MECE技能框架,确保管道设计的一致性,减少开发时间,提高输出的可维护性。通过对齐业务概念与技术模型,团队在数据工程中实现了更高的效率和治理,确保AI在生产工作流中的可靠性。

大金应用美洲公司如何利用Genie Code构建一致性的数据管道

Databricks
Databricks · 2026-06-24T18:00:00Z
现代数据工程的DataOps策略

DataOps将DevOps原则应用于数据管道,以加速交付和提高数据质量。通过自动化数据工作流和促进跨职能团队协作,DataOps持续改进数据质量,强调将数据视为产品,推动快速迭代和反馈,显著降低数据停机时间和运营成本。实施DataOps的组织报告数据停机事件减少高达99%。

现代数据工程的DataOps策略

Databricks
Databricks · 2026-06-22T19:38:25Z
数据管道最佳实践:架构、现代管道与部署

数据管道是自动化系统,用于将原始数据从源系统转移、转换为可用格式并交付给目标系统。有效的数据管道架构包括数据摄取、处理、存储和监控。选择批处理或流处理模式是关键决策,现代架构应以业务需求为基础,确保数据质量和治理。采用增量加载、自动化CI/CD和全面可观察性是提高管道可靠性的最佳实践。

数据管道最佳实践:架构、现代管道与部署

Databricks
Databricks · 2026-06-18T16:14:42Z
什么是数据管道架构?

数据管道架构是设计数据从源系统到应用和模型的过程,包括数据的收集、处理、存储和交付。架构分为逻辑设计和物理设计,定义数据流动的步骤和工具。数据管道可分为批处理和流处理,适用于不同用例。现代平台如Databricks通过Lakeflow统一这两种处理方式,简化架构,提高数据的可靠性和可用性。

什么是数据管道架构?

Databricks
Databricks · 2026-06-16T21:23:03Z
如何为机器学习预处理医疗影像——以胸部X光为例的指南

本文讨论了胸部X光影像数据集的预处理重要性,介绍了六个核心步骤:数据验证、缩放、归一化、关注区域引导、处理缺失数据和去噪。强调不当预处理可能导致模型性能下降,并提供了完整的预处理管道示例,以帮助读者有效准备医疗影像数据进行机器学习。

如何为机器学习预处理医疗影像——以胸部X光为例的指南

freeCodeCamp.org
freeCodeCamp.org · 2026-06-04T17:13:59Z
Slack AI:通往多云的道路

文章讨论了Slack在数据管道现代化方面的安全驱动转型,包括从SSH到REST的迁移,以及在网络探测和HTTP/3准备方面的可扩展性提升。

Slack AI:通往多云的道路

Slack Engineering
Slack Engineering · 2026-05-28T14:15:20Z
基于 Amazon IoT Core 与 Kiro 构建可迁移的工业 IoT 数据管道

本文介绍了如何将工业 IoT 数据管道从一个亚马逊云账户迁移到另一个账户,使用幂等的 boto3 脚本和 Kiro AI Agent 进行自动化部署。迁移过程中面临证书复用、IP 白名单和 S3 Bucket 名称唯一性等挑战。通过将手动步骤转化为 AI 可调用的工作流,提高了迁移效率和可观测性,最终实现了安全、可回滚的迁移方案,为未来的多账户治理提供了参考。

基于 Amazon IoT Core 与 Kiro 构建可迁移的工业 IoT 数据管道

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-05-26T06:21:25Z
为MHHS扩展:Octopus Energy如何在边际数据工程中实现50倍的成本降低

Octopus Energy通过重新架构数据管道,成功应对数据量增加48倍的挑战,降低了50倍的成本。新系统优化了数据处理流程,符合市场半小时结算(MHHS)要求,提升了结算和定价效率,同时增强了能源使用的智能化和可持续性。

为MHHS扩展:Octopus Energy如何在边际数据工程中实现50倍的成本降低

Databricks
Databricks · 2026-05-23T00:40:09Z

文章讨论了数据管道中Schema变更的四种形状及其对应的存储格式,包括CSV、Parquet、Delta Lake和Iceberg。不同格式在处理Schema变更时的能力差异显著,Iceberg支持自动处理列的增删和重命名,而CSV则完全依赖手动处理。选择合适的格式取决于Schema变更的频率和自动化需求。

读:数据管道中Schema变更的四种形状

暗无天日
暗无天日 · 2026-05-16T00:00:00Z
Figma如何将数据管道从多天延迟升级为实时

Figma通过改进数据管道,实现了数据同步从多天延迟到实时,采用增量同步技术,仅传输变化的数据,显著提高了数据新鲜度和处理效率。新系统节省了数百万美元,支持更大数据量,并实现了自动化验证,确保数据准确性。

Figma如何将数据管道从多天延迟升级为实时

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-05-12T15:31:03Z
重新思考现代数据平台的SQL ETL

SQL ETL实施面临碎片化挑战,导致操作复杂且难以扩展。Databricks通过统一平台整合执行、调度和监控,简化数据管道管理,提升性能和可靠性,支持多种工作流,确保团队高效协作,适应未来需求。

重新思考现代数据平台的SQL ETL

Databricks
Databricks · 2026-04-29T16:45:00Z
Databricks与Stripe Projects:为代理构建的基础设施

Databricks与Stripe Projects合作推出新工具,允许AI代理快速配置Neon Postgres数据库,无需人工干预。该工具旨在解决AI应用开发中的手动配置瓶颈。Neon的Lakebase架构支持灵活的数据库管理,使代理能够在几秒钟内创建和拆除数据库。此外,Databricks还推出了Stripe数据管道,方便用户分析支付和业务数据。

Databricks与Stripe Projects:为代理构建的基础设施

Databricks
Databricks · 2026-04-29T15:20:00Z
使用 Genie Code 和 Lakeflow 的自主数据工程

Genie Code 是一种数据工程工具,允许工程师通过自然语言生成数据管道,简化开发、调度和故障调试。它能将原本需要数周的任务缩短至数小时,并确保符合治理标准。未来将推出 AI 优化工作负载,进一步提升效率。

使用 Genie Code 和 Lakeflow 的自主数据工程

Databricks
Databricks · 2026-04-28T15:00:00Z
领先科技公司如何通过Lakebase消除构建者的负担

文章讨论了AI原生应用架构的转变,强调数据管道的重要性。传统数据架构效率低下,技术公司通过采用Lakebase架构整合操作与分析层,实现实时数据访问和持续学习。案例显示,使用Lakebase后,企业在数据处理速度、准确性和运营效率上显著提升,消除了交易系统与分析平台之间的隔阂,推动AI系统的持续改进。

领先科技公司如何通过Lakebase消除构建者的负担

Databricks
Databricks · 2026-04-27T23:23:08Z
Python中的高效数据处理:批处理与流处理管道解析

在编写数据管道代码前,需要选择批处理或流处理。批处理适合处理历史数据,适用于数据新鲜度要求低的场景;流处理则适合实时需求。选择时需考虑数据新鲜度、处理复杂性和操作能力。混合架构(如Lambda和Kappa)结合了两者的优点,适应不同场景。理解这两种模式有助于选择合适的解决方案。

Python中的高效数据处理:批处理与流处理管道解析

freeCodeCamp.org
freeCodeCamp.org · 2026-04-13T13:51:23Z
数据管道决定企业通信的投资回报率

根据Fivetran报告,标准化和完全托管的数据管道可提升企业投资回报率(ROI)45%。然而,遗留技术和语义不一致等问题使得标准化面临挑战。企业需优先处理关键数据,建立完善基础设施,以提高数据管道的效率和可靠性。

数据管道决定企业通信的投资回报率

实时互动网
实时互动网 · 2026-04-13T02:04:57Z
Datadog如何重新定义数据复制

Datadog通过将Postgres数据复制到专用搜索平台解决性能问题,采用异步复制提高速度但引入数据延迟。为应对模式演变,建立自动化验证系统和兼容性注册表,确保数据流畅,简化多个数据管道管理,提升整体效率。

Datadog如何重新定义数据复制

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-04-01T15:31:07Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码