小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Taylor Farms pulls iceberg lettuce from the US market after cyclosporiasis outbreak

Food producer Taylor Farms released a statement on the Cyclospora outbreak Friday, confirming that it's "voluntarily removing all iceberg lettuce sourced from central Mexico from the US market."...

Taylor Farms pulls iceberg lettuce from the US market after cyclosporiasis outbreak

The Verge
The Verge · 2026-07-17T22:09:47Z
使用 Amazon S3 Tables 优化数据湖:从Hudi 迁移到托管 Iceberg

某零售品牌因Hudi版本老化和性能问题,迁移至Amazon S3 Tables。采用混合策略,DW层使用增量MERGE,DM层全量覆盖写Parquet。迁移后,核心作业性能提升8倍,ETL成本降低72%。通过新旧并行迁移,确保零停机和数据正确性。

使用 Amazon S3 Tables 优化数据湖:从Hudi 迁移到托管 Iceberg

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-08T01:30:30Z

本文探讨了SQL查询优化中的裁剪链路,分析了Trino、Spark和DuckDB在处理Iceberg表时的不同策略。通过四层漏斗模型,描述了SQL谓词到布局约束的转化过程,以及各引擎在规划和执行阶段的职责分工。实验结果表明,优化器能够有效减少扫描的数据量,提高查询效率。

【分布式 OLAP 查询引擎】Iceberg 下推全链路:Planner 视角

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-07T00:00:00Z

本文探讨了Trino查询引擎的执行流程,包括分析、计划、分片和调度等阶段,重点介绍了Iceberg表的元数据处理及其对查询性能的影响。通过分析SqlQueryExecution的生命周期,阐明了SQL查询如何转化为分布式执行计划,并强调了EXPLAIN和EXPLAIN ANALYZE的使用,以优化查询效率。

【分布式 OLAP 查询引擎】Trino 查询路径:从 SqlQueryExecution 到 Page 流

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-07T00:00:00Z

本文比较了Trino与Spark SQL在数据处理中的差异,分析了两者的查询执行路径、优化机制及Iceberg连接器的能力。Trino采用解释型操作,而Spark通过全阶段代码生成和自适应查询执行来提升性能。文章还对比了两者在Iceberg下推能力,强调了各自的适用场景和优化风格。

【分布式 OLAP 查询引擎】Spark SQL 与 Catalyst:逻辑/物理计划与 AQE

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-07T00:00:00Z

本文讨论了Debezium在变更数据捕获(CDC)管道中的作用,特别是如何通过Kafka将数据库变更传输到Flink或Iceberg。重点在于理解变更事件的结构,包括操作类型(插入、更新、删除)及其对应的前后镜像。文章还探讨了快照与增量数据的处理,以及在数据湖中进行upsert时的主键和顺序要求,强调了Debezium与Flink、Iceberg之间的协作关系。

【流式数据处理】Debezium 与 Change Data Capture

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-01T00:00:00Z

本文探讨了Flink与Iceberg在流式数据入湖中的配置与优化,分析了checkpoint间隔、提交频率与小文件数量的关系。通过调整checkpoint参数和并行度,优化提交过程,减少背压对数据可见性的影响。同时介绍了预聚合和bucket分区策略,以提高写入效率并降低小文件生成。最后提供了CDC入湖作业的检查清单,确保数据一致性与性能。

【流式数据处理】流式入湖深化(与 Lakehouse 第 19 章对读)

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-01T00:00:00Z

Iceberg通过四层不可变元数据树解决了对象存储中的目录管理问题。这四层分别存储表的状态、快照信息、manifest列表和数据文件,确保原子提交和快照隔离。查询时,Iceberg利用元数据快速定位数据文件,避免了传统方法中的高成本LIST操作,并支持高效的分区裁剪和文件裁剪,提升查询性能。

【数据湖与开放表格式】Iceberg 元数据树

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

Iceberg通过隐藏分区和分区演进解决了Hive的分区问题。隐藏分区允许用户在数据列上写谓词,系统自动裁剪分区,避免全表扫描。分区演进则允许在不重写历史数据的情况下修改分区方案,保留旧数据的同时新增分区规范。这些设计提高了数据管理的灵活性和效率。

【数据湖与开放表格式】隐藏分区与分区演进

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

在Iceberg中,数据文件不可变,删除行可通过写时复制(CoW)和读时合并(MoR)两种方式实现。CoW重写整个文件,写放大高;MoR则写删除标记,适合高频删除。V3引入删除向量(DV),提高了删除效率。选择CoW或MoR取决于删除频率和读写性能需求。实验表明,CoW在删除时重写大量数据,而MoR需定期合并以避免性能下降。

【数据湖与开放表格式】行级删除与 Merge-on-Read

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z
地理空间无限:支持AI/BI地图的空间SQL GA、Delta Sharing和Iceberg v3

Databricks推出了支持空间SQL的湖仓平台,简化了保险公司在飓风来临时的空间数据分析。用户可以快速查询受影响的保单和风险区域,提升数据处理效率。新功能包括改进的空间连接和ST_函数,支持地图可视化,方便生成仪表板。通过Delta Sharing,数据共享更加高效,确保数据治理和访问控制。

地理空间无限:支持AI/BI地图的空间SQL GA、Delta Sharing和Iceberg v3

Databricks
Databricks · 2026-06-11T17:06:38Z
Unity Catalog 与 Apache Iceberg™ 的下一个时代

Unity Catalog 是一个全面的 Apache Iceberg 目录,具备开放 API、目录联合和跨引擎访问控制等功能。它支持多种引擎,确保数据治理和优化,帮助企业实现安全共享和高效管理,满足 AI 应用需求。同时,Unity Catalog 提供自动优化,提升查询性能,推动 Iceberg 和 Delta 的统一发展。

Unity Catalog 与 Apache Iceberg™ 的下一个时代

Databricks
Databricks · 2026-05-28T18:58:09Z

At the Apache Iceberg Summit last month, Google announced new interoperability features for Apache Iceberg in BigQuery. The preview of the serverless Iceberg REST catalog lets teams create,...

Google Cloud Introduces Cross-Engine Iceberg Support in BigQuery

InfoQ
InfoQ · 2026-05-23T08:42:00Z

文章讨论了数据管道中Schema变更的四种形状及其对应的存储格式,包括CSV、Parquet、Delta Lake和Iceberg。不同格式在处理Schema变更时的能力差异显著,Iceberg支持自动处理列的增删和重命名,而CSV则完全依赖手动处理。选择合适的格式取决于Schema变更的频率和自动化需求。

读:数据管道中Schema变更的四种形状

暗无天日
暗无天日 · 2026-05-16T00:00:00Z
ASF项目聚焦:Apache Iceberg

Dipankar Mazumdar是Cloudera开发者关系总监,专注于湖屋架构和人工智能。他介绍了Apache Iceberg,这是一种高性能的开放表格式,旨在提高数据湖的可靠性和简便性。Iceberg解决了传统数据湖的更新不可靠和元数据处理成本高等问题。该项目于2018年开源,促进了社区合作与采用。未来,Iceberg将支持更多AI驱动的工作负载,关注灵活的数据表示和索引改进。

ASF项目聚焦:Apache Iceberg

The Apache Software Foundation Blog
The Apache Software Foundation Blog · 2026-04-29T16:22:08Z
Postgres到Iceberg仅需13分钟:Supermetal与Flink、Kafka Connect和Spark的比较

Supermetal在将Postgres数据写入Iceberg时表现优异,快照仅需13分钟,远快于Flink(90-116分钟)、Kafka Connect(120分钟)和Spark(超过3小时)。其优势在于根据CDC源阶段切换配置选项以优化性能,测试显示Supermetal在未调优情况下快照性能至少比其他工具快7倍,主要得益于快速的CDC源和低序列化开销。

Postgres到Iceberg仅需13分钟:Supermetal与Flink、Kafka Connect和Spark的比较

The New Stack
The New Stack · 2026-04-15T15:00:00Z

Monitoring MySQL data locks, or the tip of the iceberg This story is about recent (*) performance improvements implemented in MySQL, related to monitoring of data locks. (*) Originally written in...

Monitoring MySQL data locks, or the tip of the iceberg

Planet MySQL
Planet MySQL · 2026-04-15T13:13:51Z
开放湖仓的下一个时代:Databricks上Apache Iceberg™ v3公测

Databricks的Iceberg v3进入公测,支持增量数据处理和半结构化数据分析,简化数据管道。新特性包括行血统、删除向量和VARIANT类型,提升性能,支持多引擎互操作性,优化数据治理,降低维护成本。

开放湖仓的下一个时代:Databricks上Apache Iceberg™ v3公测

Databricks
Databricks · 2026-04-09T17:10:42Z
S3 Tables 实战:两种方案,把 MySQL 数据实时”搬”进 S3 Tables

本文介绍了将MySQL变更数据实时同步到Amazon S3 Tables的两种方案:基于MSK Connect和Iceberg Kafka Connect的全托管方案,以及基于Flink CDC和Iceberg Dynamic Sink的流处理方案。S3 Tables提供自动表维护功能,简化了Iceberg数据湖的运维,支持高并发写入和优化查询性能。

S3 Tables 实战:两种方案,把 MySQL 数据实时”搬”进 S3 Tables

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-03-27T05:21:59Z
Etleap推出Iceberg管道平台,简化企业对Apache Iceberg的采用

Etleap推出Iceberg管道平台,简化企业Apache Iceberg的数据管道管理。该平台整合数据摄取、转换和表操作,运行在客户私有云中,解决数据平台领导者的日常操作难题,消除复杂定制堆栈,支持跨云和计算引擎的工作负载移植,提高效率和一致性。

Etleap推出Iceberg管道平台,简化企业对Apache Iceberg的采用

InfoQ
InfoQ · 2026-02-03T12:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码