R2 Data Catalog 是直接内置于 R2 存储桶的托管 Apache Iceberg ↗ 数据 catalog。它公开标准的 Iceberg REST catalog 接口,因此您可以连接已使用的引擎,例如 Spark、Snowflake 和 PyIceberg。
R2 Data Catalog 可以轻松将 R2 存储桶转变为数据仓库或 lakehouse,适用于日志分析、商业智能和数据管道等多种分析工作负载。R2 的零出口费用模式意味着数据用户和消费者可以从不同云、数据平台或区域访问和分析数据,而无需承担传输成本。
要开始使用 R2 Data Catalog,请参阅 R2 Data Catalog:快速入门。
Apache Iceberg ↗ 是一种开放表格式,专为处理存储在对象存储中的大规模分析数据集而设计。主要特性包括:
- ACID 事务 — 确保可靠、并发的读写操作,保证数据完整性。
- 优化的元数据 — 通过索引元数据避免代价高昂的全表扫描,加快查询速度。
- 完整的 schema 演进 — 支持添加、重命名和删除列,而无需重写数据。
Iceberg 已得到 Apache Spark、Trino、Snowflake、DuckDB 和 ClickHouse 等引擎的广泛支持 ↗,背后有快速增长的社区。
虽然 Iceberg 数据和元数据文件本身直接存储在对象存储(如 R2)中,但表列表和指向当前元数据的指针需要由数据 catalog 集中跟踪。
可以将数据 catalog 想象成图书馆的索引系统。虽然书籍(您的数据)物理上分布在各个书架(对象存储)上,但索引提供了关于存在哪些书籍、它们的位置以及最新版本的单一真实来源。没有这个索引,读者(查询引擎)将浪费时间寻找书籍,可能访问过时的版本,或可能以导致无法找到的方式存放新书。
同样,数据 catalog 确保一致、协调的访问,使多个查询引擎能够安全地读写同一张表,而不会发生冲突或数据损坏。
快速入门
了解如何在存储桶上启用 R2 Data Catalog、加载示例数据并运行首次查询。
管理 catalog
在存储桶上启用或禁用 R2 Data Catalog、检索配置详情,并为 Iceberg 引擎进行身份验证。
连接到 Iceberg 引擎
查找 Apache Spark 及其他常用查询引擎的详细设置说明。