跳转到内容
搜索文档

R2 Data Catalog

最后更新 查看 MarkdownAgent 设置

R2 Data Catalog 是直接内置于 R2 存储桶的托管 Apache Iceberg 数据 catalog。它公开标准的 Iceberg REST catalog 接口,因此您可以连接已使用的引擎,例如 SparkSnowflakePyIceberg

R2 Data Catalog 可以轻松将 R2 存储桶转变为数据仓库或 lakehouse,适用于日志分析、商业智能和数据管道等多种分析工作负载。R2 的零出口费用模式意味着数据用户和消费者可以从不同云、数据平台或区域访问和分析数据,而无需承担传输成本。

要开始使用 R2 Data Catalog,请参阅 R2 Data Catalog:快速入门

什么是 Apache Iceberg?

Apache Iceberg 是一种开放表格式,专为处理存储在对象存储中的大规模分析数据集而设计。主要特性包括:

  • ACID 事务 — 确保可靠、并发的读写操作,保证数据完整性。
  • 优化的元数据 — 通过索引元数据避免代价高昂的全表扫描,加快查询速度。
  • 完整的 schema 演进 — 支持添加、重命名和删除列,而无需重写数据。

Iceberg 已得到 Apache Spark、Trino、Snowflake、DuckDB 和 ClickHouse 等引擎的广泛支持,背后有快速增长的社区。

为什么需要数据 catalog?

虽然 Iceberg 数据和元数据文件本身直接存储在对象存储(如 R2)中,但表列表和指向当前元数据的指针需要由数据 catalog 集中跟踪。

可以将数据 catalog 想象成图书馆的索引系统。虽然书籍(您的数据)物理上分布在各个书架(对象存储)上,但索引提供了关于存在哪些书籍、它们的位置以及最新版本的单一真实来源。没有这个索引,读者(查询引擎)将浪费时间寻找书籍,可能访问过时的版本,或可能以导致无法找到的方式存放新书。

同样,数据 catalog 确保一致、协调的访问,使多个查询引擎能够安全地读写同一张表,而不会发生冲突或数据损坏。

了解更多

快速入门

了解如何在存储桶上启用 R2 Data Catalog、加载示例数据并运行首次查询。

管理 catalog

在存储桶上启用或禁用 R2 Data Catalog、检索配置详情,并为 Iceberg 引擎进行身份验证。

这篇文档对您有帮助吗?