R2 Data Catalog 压缩现在优化清单文件
R2 Data Catalog 是直接内置于 R2 的托管 Apache Iceberg ↗ 目录,现在作为压缩的一部分自动优化清单文件。
清单文件跟踪组成 Iceberg 表的数据文件。随着表积累了许多小型或碎片化的清单,查询引擎在查询规划期间必须读取更多元数据,这会导致查询变慢,甚至在扫描任何数据之前就已如此。
当压缩运行时,R2 Data Catalog 现在会按分区重写和聚簇清单文件作为尽力而为的预处理步骤。这可以整合碎片化的清单,减少查询引擎必须打开的清单数量,并降低元数据 I/O 开销。已经聚簇良好的表将被跳过,因此该操作仅在能带来收益时才运行。
对于已启用压缩的表,此功能自动生效——无需任何配置更改。
如需更多信息,请参阅表维护。