隆重推出 Cloudflare Basin:开放的无服务器数据平台,现已正式可用

💡 原文英文,约2700词,阅读约需10分钟。
📝

内容提要

Cloudflare在生日周宣布数据平台正式可用,更名为Cloudflare Basin。该平台基于Apache Iceberg和R2对象存储,包含三大产品:Basin Pipelines负责数据摄取与转换,Basin Catalog管理Iceberg元数据并自动维护表,Basin SQL提供无服务器分布式查询引擎。平台强调速度、开放性和成本效益,支持零出口费用,可搭配多种Iceberg兼容引擎使用。

🔎

延伸解读

从测试到正式:Basin 的成熟度提升

Cloudflare Basin 由测试版转为正式可用,并更名。这意味平台在稳定性、功能完整性和支持上达到生产标准。早期采用者包括 Cloudflare 内部计费和基础设施团队,以及 Anomaly 等公司,已将整个数据管道迁移至 Basin,替换了复杂的 AWS S3 和 Athena 设置。正式版还扩展了可扩展性,如 Pipelines 支持每流高达 3GB/s 的摄取速率。

开放标准与零出口费用的实际影响

Basin 基于 Apache Iceberg 和 R2 对象存储,强调开放性和成本效益。由于 R2 不收取出口费用,开发者可以自由使用任何 Iceberg 兼容引擎(如 PyIceberg、DuckDB、Snowflake、Apache Spark)读写数据,无需担心跨云或跨区域访问成本。这种数据可移植性有助于避免供应商锁定,并支持在不同工具和团队间灵活协作。

无服务器架构与按使用计费

Basin 采用无服务器架构,用户无需预置集群或管理基础设施,仅按数据摄取、处理和查询量计费。没有小时费用或额外基础设施成本,适合从 hobby 项目到大型企业用例。Basin SQL 作为分布式查询引擎,自动扩展 across Cloudflare 全球网络,并利用 Catalog 生成的统计信息优化查询计划,保持大规模数据集下的查询性能。

功能演进与未来路线

自测试版以来,Basin 各组件持续增强:Pipelines 增加了 Logpush 集成、Worker 绑定类型安全和数据质量错误可见性;Catalog 实现了自动压缩、快照过期和清单优化;SQL 支持数百个函数、连接和窗口函数。未来计划包括自定义分区、模式迁移、Iceberg V3 支持、高级统计和自适应调度,以及更完善的数据合规和主权工具。

❓

Q&A

Cloudflare Basin 是什么?它包含哪些产品?

Cloudflare Basin 是一个基于 Apache Iceberg 和 R2 对象存储的无服务器数据分析平台,现已正式可用。它包含三个产品:Basin Pipelines(负责数据摄取与转换)、Basin Catalog(管理 Iceberg 元数据并自动维护表)、Basin SQL(无服务器分布式 SQL 查询引擎)。

Cloudflare Basin 为什么强调开放性和数据可移植性?

Basin 基于 Apache Iceberg 开放标准构建,数据可被任何 Iceberg 兼容引擎读写,如 PyIceberg、DuckDB、Snowflake 和 Apache Spark。同时,R2 的零出口费用使得数据可以自由访问,不受区域或云提供商限制,实现了真正的数据可移植性。

Basin Pipelines 的主要功能是什么?它如何帮助处理数据?

Basin Pipelines 负责数据摄取与转换。它通过 HTTP 端点或 Workers 绑定接收事件,用 SQL 查询进行转换,然后以 Apache Iceberg 表或 R2 中的 JSON/Parquet 文件形式输出。它支持 Cloudflare Logpush 集成,可转换日志并存储为压缩 Parquet 或 Iceberg 表,还能在摄取时减少存储占用、过滤敏感数据。

Basin Catalog 如何自动维护 Iceberg 表?

Basin Catalog 自动执行常规维护以保持表性能和健康,包括:按表设置压缩策略、自动过期旧快照并保留最近快照、清理未引用的数据文件、以及在压缩前优化清单文件以减少元数据 I/O。

Basin SQL 支持哪些查询功能?

Basin SQL 支持标准及近似聚合、GROUP BY、HAVING、超过 190 个标量和聚合函数、CASE 表达式、CTE、类型转换、EXPLAIN、多种 JOIN、子查询、DISTINCT、UNION、INTERSECT、EXCEPT、窗口函数、QUALIFY、分组集、ROLLUP、CUBE 以及一系列 JSON 函数。

Cloudflare Basin 的定价模式是怎样的?

Basin 采用基于用量的定价,仅在数据摄取、处理或查询时计费。没有小时费用或单独的基础设施成本。免费出口费用进一步降低了成本,适合从 hobby 项目到大型企业用例。

🏷️

标签

➡️

继续阅读