DuckLake是一种基于DuckDB扩展的湖仓格式,将元数据与数据分离:目录(本地文件或PostgreSQL)存储表结构、快照和文件指针,Parquet文件存储实际数据。支持本地运行及PostgreSQL+MinIO生产部署,通过分区将文件组织在S3中。查询时利用目录中的列统计进行分区剪枝和谓词下推,可跳过无关文件,显著提升查询效率。
MongoDB 发布安全公告,提醒用户关注 Percona Tools for MongoDB 中的多个 CVE 漏洞,并建议立即更新以防范潜在风险。
Percona MongoDB Operator 1.23.0发布,新增ClusterSync迁移、向量搜索及PVC快照备份功能。另有文章介绍如何从MySQL Galera集群迁移至Percona XtraDB集群。
本文是SQLite内核系列第17篇(末篇),总结选型决策树:根据网络多写者、SQL需求、分析负载等条件,选择PostgreSQL/InnoDB、DuckDB、RocksDB或SQLite。SQLite适合嵌入式行存OLTP,单文件、零IPC、单写者。文章还提供站内阅读地图、学术谱系(如Bayer & McCreight 1972)及开放问题,如单写者权衡、WAL checkpoint策略等。
Percona Operator for MySQL 1.2.0版本新增了跨站点复制、加密备份和自动存储扩展功能,提升了MySQL的安全性和灵活性。
本文探讨了DuckDB与Trino的区别。DuckDB作为嵌入式OLAP引擎,适合单机分析,支持向量化和morsel-driven并行处理,能够高效读取Parquet和Iceberg格式数据。实验表明,DuckDB在小规模数据处理时能有效进行投影裁剪和谓词下推,但在多租户和大数据场景下仍需使用Trino。
本文探讨了分布式OLAP查询引擎(如Trino、Spark、DuckDB)的优化与MPP执行,分析了SQL从解析到执行的各个阶段,包括逻辑与物理优化、执行模型和下推机制,旨在帮助数据平台工程师和架构负责人理解交互式SQL在数据湖上的应用与性能调优。
DuckDB 是一种嵌入式列向量化分析引擎,适用于单机分析和数据科学。其架构包括 Catalog、Optimizer、Execution 和 Storage,支持 SQL 查询,并能直接处理 Parquet 和 CSV 文件。DuckDB 更适合零运维的嵌入式分析场景,支持 ACID 事务,适合小规模数据分析。
DuckDB 采用向量批处理和 morsel-driven 并行执行模型,显著提升数据处理效率。在 OLAP 任务中,DuckDB 的表现优于 PostgreSQL 和 ClickHouse,支持动态任务调度和负载均衡。其物理算子通过管道化处理数据,优化哈希连接和聚合操作,优化器通过下推谓词和动态规划提升查询性能。
本文比较了DuckDB与ClickHouse在OLAP场景中的应用,指出两者适用场景不同。DuckDB适合嵌入式分析和小规模数据,而ClickHouse更适合大规模数据处理和多用户访问。通过决策树,用户可以根据需求选择合适的工具,结合使用可提高效率。
本文探讨了ClickHouse与DuckDB的列存引擎,分析了列存文件格式、查询读取路径、MergeTree合并机制及索引特性,旨在帮助数据平台工程师、DBA及嵌入式分析开发者理解列存技术及其在生产环境中的应用与挑战。
DuckDB has recently announced Quack, a new remote protocol over HTTP that lets multiple DuckDB instances connect to and work with the same database over a network. The protocol introduces...
在最近的MCP开发峰会上,MotherDuck的AI负责人Till Döhmen讨论了如何利用DuckDB数据库,使非技术员工能够直接与数据互动。MotherDuck与DuckDB基金会紧密合作,推动数据库的扩展,Döhmen表示他们不打算分叉DuckDB,而是对其进行必要的修改。该公司在开源项目上取得成功,并吸引了风险投资的增长。
SwanLake 是基于 Rust 的 Arrow Flight SQL Server,结合 DuckDB 和 DuckLake,旨在提供可部署和可观测的数据服务。它通过五层架构实现高效的查询和会话管理,支持对象存储和元数据统一管理,提升系统的可观测性和性能。
SwanLake是一个基于Rust的DuckDB服务,旨在简化集成和操作。它结合了DuckDB、DuckLake和Flight SQL,提供高效的查询接口和会话管理,适用于数据湖场景,并注重可观察性,内置状态页面和性能指标,适合生产环境。
现代数据分析可以通过使用Parquet文件和DuckDB简化,直接查询数据,避免传统数据库的复杂性。这种方法提高了分析效率,适合批量处理结构化数据。
目前有三种将 PostgreSQL 与 DuckDB 集成的方案:pg_duckdb(仅支持存量数据迁移)、pg_mooncake(支持存量和增量数据同步)以及 pg_lake(仅支持全量数据导入)。PostgreSQL 的逻辑复制能力较弱,且缺乏可插拔存储引擎,而 MySQL 的设计更适合支持 DuckDB 的列存,并且其 binlog 机制对生态支持良好。
MySQL的插件式存储引擎架构支持多种存储引擎,主要包括默认的InnoDB(适合OLTP)和专为OLAP设计的DuckDB。DuckDB与MySQL兼容,提升查询性能并降低存储成本。
DuckDB最近推出了与Iceberg REST Catalogs的无服务器端到端交互,用户无需基础设施设置即可在浏览器中查询、读取和写入Iceberg表。该功能基于DuckDB-Wasm,确保浏览器和本地版本执行相同逻辑,用户可通过演示访问自己的S3表,所有计算在浏览器本地运行。
DuckDB是一款嵌入式SQL数据库,专注于高性能交互式分析,支持列式存储和向量化执行,适合数据探索和ETL工作,兼容Python、R、Go等多种语言。
完成下面两步后,将自动完成登录并继续当前操作。