小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
CNCF云原生人工智能数据存储白皮书

现代企业在云原生基础设施中部署人工智能和机器学习工作负载时面临数据瓶颈。CNCF基础设施技术顾问组发布白皮书,探讨数据湖、向量数据库、缓存策略及标准化接口等关键技术,以优化数据存储和处理,支持AI生命周期中的模型训练、推理和智能代理。

CNCF云原生人工智能数据存储白皮书

Cloud Native Computing Foundation
Cloud Native Computing Foundation · 2026-07-08T17:35:54Z
使用 Amazon S3 Tables 优化数据湖:从Hudi 迁移到托管 Iceberg

某零售品牌因Hudi版本老化和性能问题,迁移至Amazon S3 Tables。采用混合策略,DW层使用增量MERGE,DM层全量覆盖写Parquet。迁移后,核心作业性能提升8倍,ETL成本降低72%。通过新旧并行迁移,确保零停机和数据正确性。

使用 Amazon S3 Tables 优化数据湖:从Hudi 迁移到托管 Iceberg

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-08T01:30:30Z

本文探讨了分布式OLAP查询引擎(如Trino、Spark、DuckDB)的优化与MPP执行,分析了SQL从解析到执行的各个阶段,包括逻辑与物理优化、执行模型和下推机制,旨在帮助数据平台工程师和架构负责人理解交互式SQL在数据湖上的应用与性能调优。

【分布式 OLAP 查询引擎】Trino · Spark · DuckDB · 优化与 MPP 执行

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-07T00:00:00Z

本文探讨了数据湖与开放表格式的关系,分析了Hive表的局限性及其在对象存储中的应用问题。Hive表依赖目录重命名,缺乏原子提交,导致部分提交和并发写入问题。开放表格式(如Iceberg、Delta、Hudi)通过将表拆分为不可变数据文件、可变元数据和原子切换的catalog指针,解决了这些问题,实现了在对象存储上支持ACID和时间旅行的能力。

【数据湖与开放表格式】Lakehouse 全景:从 Hive 表到开放表格式

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

本文探讨了Parquet文件的结构与性能优化,包括数据的物理切分(行组、列块、页面)、元数据存储方式,以及通过裁剪元数据(如列索引、偏移索引、布隆过滤器)提高查询效率。Parquet采用“先写数据、后写元数据”的设计,文件尾部包含所有统计信息,支持高效的谓词下推和投影下推,显著减少读取数据的IO量。

【数据湖与开放表格式】Parquet 文件格式深拆

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

ORC和Parquet是两种列式存储格式,分别源自Hive和Twitter/Cloudera。ORC适合Hive事务表,支持ACID,且在整数和时间戳数据上压缩效果好。Parquet是跨引擎的通用格式,广泛应用于AI和数据分析工具。选择时需考虑具体应用场景和数据特性。

【数据湖与开放表格式】ORC 文件格式与 Parquet 对照

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

Apache Arrow 旨在解决不同系统间的数据内存表示问题,通过定义一种与语言无关的列式内存格式,实现零拷贝共享。其内存布局包括有效性位图和数据缓冲区,支持高效分析运算。C 数据接口允许在同一进程中无拷贝传递数据,而 IPC 和 Flight 则支持跨进程和网络传输。Arrow 与 Parquet 互补,前者优化内存计算,后者优化磁盘存储。

【数据湖与开放表格式】Apache Arrow 内存格式与零拷贝

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

本章探讨了Parquet格式的编码与压缩机制,强调编码降熵与通用压缩的两层结构。实测结果显示,低基数列适合字典编码,近似等差整数列使用差分编码效果最佳,而高熵随机数据则难以压缩。总结了编码与压缩的选择原则,强调匹配数据模式的重要性。

【数据湖与开放表格式】列式编码与压缩

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

本文讨论了对象存储(如S3)与POSIX文件系统的关键差异,强调对象存储的强一致性、重命名操作的高成本及条件写的重要性。对象存储不支持原子重命名,导致重命名变为逐个复制和删除,增加了成本。此外,列出对象的代价随对象数量线性增长,影响数据处理效率。条件写(如If-None-Match)为原子提交提供了支点,解决了并发写入的问题。整体上,文章探讨了对象存储在数据湖架构中的局限性及其对表格式设计的影响。

【数据湖与开放表格式】对象存储语义与代价

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

本文讨论了对象存储中目录式分区表的缺陷,如并发写入导致的部分提交、查询规划成本高和缺乏快照隔离。为解决这些问题,开放表格式(如Iceberg、Delta、Hudi)提供了原子提交、快照隔离、文件级统计裁剪和schema演进等功能,确保数据一致性和高效查询。

【数据湖与开放表格式】表格式为什么存在

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

Iceberg通过四层不可变元数据树解决了对象存储中的目录管理问题。这四层分别存储表的状态、快照信息、manifest列表和数据文件,确保原子提交和快照隔离。查询时,Iceberg利用元数据快速定位数据文件,避免了传统方法中的高成本LIST操作,并支持高效的分区裁剪和文件裁剪,提升查询性能。

【数据湖与开放表格式】Iceberg 元数据树

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

Iceberg通过隐藏分区和分区演进解决了Hive的分区问题。隐藏分区允许用户在数据列上写谓词,系统自动裁剪分区,避免全表扫描。分区演进则允许在不重写历史数据的情况下修改分区方案,保留旧数据的同时新增分区规范。这些设计提高了数据管理的灵活性和效率。

【数据湖与开放表格式】隐藏分区与分区演进

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

在Iceberg中,数据文件不可变,删除行可通过写时复制(CoW)和读时合并(MoR)两种方式实现。CoW重写整个文件,写放大高;MoR则写删除标记,适合高频删除。V3引入删除向量(DV),提高了删除效率。选择CoW或MoR取决于删除频率和读写性能需求。实验表明,CoW在删除时重写大量数据,而MoR需定期合并以避免性能下降。

【数据湖与开放表格式】行级删除与 Merge-on-Read

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z
OceanBase发布AI数据库:以一套引擎融合湖库与多模态数据

OceanBase发布了面向AI时代的湖库一体AI数据库,旨在通过统一的数据管理架构提升AI对企业业务的理解能力。该数据库结合了数据湖和数据库的优势,支持多模态数据处理,帮助智能体获取完整的业务上下文。OceanBase的产品体系包括Lakebase、DataStudio和DataPilot,已在多个AI场景中验证有效性。

OceanBase发布AI数据库:以一套引擎融合湖库与多模态数据

量子位
量子位 · 2026-06-29T08:49:38Z
从测试台到数据湖:AVL如何通过Impulse现代化测量数据分析

Impulse是一个基于Python的分析库,旨在提升汽车测试数据的分析效率。AVL利用Impulse在Databricks平台上构建了数据湖,支持测量数据的管理与分析。该平台通过分层数据模型简化数据处理流程,使工程师能够快速定义事件、计算统计并生成可视化结果,推动数据驱动的产品开发。Impulse的发布为汽车数据分析设立了新标准,并计划扩展至ADAS和自动驾驶领域。

从测试台到数据湖:AVL如何通过Impulse现代化测量数据分析

Databricks
Databricks · 2026-06-25T19:30:00Z
为AI代理打造的细致数据湖:AWS Context在推理能力上焕然一新

AWS推出AWS Context服务,通过知识图谱自动映射企业数据关系,提升AI代理的决策能力。该服务允许开发者控制数据输入,确保AI代理获取最新的上下文信息,并支持Amazon Quick,帮助AI代理在组织内共享和利用知识图谱,提高决策的准确性和智能化。

为AI代理打造的细致数据湖:AWS Context在推理能力上焕然一新

The New Stack
The New Stack · 2026-06-17T18:00:00Z
开放表格式与开放目录的融合:Catalog Commits现已全面上线

Catalog Commits是Delta表的新标准,旨在统一数据湖的管理与访问,解决多引擎和多表协调的挑战,增强数据治理,支持跨表事务,提升数据湖的性能与开放性。Databricks上的UC管理表已全面支持Catalog Commits。

开放表格式与开放目录的融合:Catalog Commits现已全面上线

Databricks
Databricks · 2026-05-12T15:00:00Z
Amazon Redshift 推出带有集成数据湖查询引擎的基于 AWS Graviton 的 RG 实例

Amazon Redshift 推出了基于 AWS Graviton 的 RG 实例,集成数据湖查询引擎,查询速度比 RA3 实例快 2.2 倍,支持在数据仓库和数据湖中运行 SQL 分析,简化操作并降低分析成本。新实例已在多个 AWS 区域上线,用户可通过 AWS 控制台启动或迁移集群。

Amazon Redshift 推出带有集成数据湖查询引擎的基于 AWS Graviton 的 RG 实例

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-05-12T03:33:27Z
ASF项目聚焦:Apache Iceberg

Dipankar Mazumdar是Cloudera开发者关系总监,专注于湖屋架构和人工智能。他介绍了Apache Iceberg,这是一种高性能的开放表格式,旨在提高数据湖的可靠性和简便性。Iceberg解决了传统数据湖的更新不可靠和元数据处理成本高等问题。该项目于2018年开源,促进了社区合作与采用。未来,Iceberg将支持更多AI驱动的工作负载,关注灵活的数据表示和索引改进。

ASF项目聚焦:Apache Iceberg

The Apache Software Foundation Blog
The Apache Software Foundation Blog · 2026-04-29T16:22:08Z
EP212:数据仓库与数据湖与数据网格

数据仓库、数据湖和数据网格是三种数据存储方式。数据仓库结构化存储,查询快速但添加新数据源困难;数据湖灵活性高但管理复杂;数据网格将数据所有权分散,适合大型组织但需确保数据质量。许多公司结合使用这三种方法以满足不同需求。

EP212:数据仓库与数据湖与数据网格

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-04-25T15:30:59Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码