Tentang endpoint katalog Apache Iceberg kustom untuk BigQuery

Endpoint katalog Apache Iceberg kustom untuk BigQuery menghubungkan mesin kueri open source seperti Apache Spark dan Apache Flink ke katalog runtime Lakehouse. Dengan mengintegrasikan plugin katalog kustom (BigQueryMetastoreCatalog), endpoint ini memungkinkan Anda mengelola dan membuat kueri metadata tabel Apache Iceberg langsung melalui BigQuery sambil menyimpan file data dan metadata di Cloud Storage.

Cara kerja katalog Iceberg kustom

Katalog Apache Iceberg kustom menggunakan implementasi katalog kustom (org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog) yang disediakan dalam library JAR. Saat workload komputasi Anda berjalan di Managed Service untuk Apache Spark, mesin akan menggunakan plugin ini untuk berinteraksi dengan BigQuery sebagai penyimpanan metadata untuk tabel Apache Iceberg Anda.

Alur kerja beroperasi sebagai berikut:

  1. Implementasi katalog: Mesin kueri memuat JAR katalog BigQuery Metastore dan mengonfigurasi properti katalog sesi Spark untuk menggunakan org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog.
  2. Pengelolaan metadata: Saat Anda membuat atau mengubah tabel menggunakan Spark SQL atau DataFrame API, plugin akan menyimpan definisi set data dan tabel di BigQuery.
  3. Penyimpanan data: File metadata Apache Iceberg (metadata.json, daftar manifes, manifes) dan file data (seperti file Parquet) disimpan langsung di jalur warehouse Cloud Storage yang Anda tentukan.
  4. Akses lintas-mesin: Karena metadata terdaftar di BigQuery, Anda dapat membuat kueri tabel dari mesin open source seperti Spark dan langsung dari BigQuery.

Hierarki resource

Endpoint katalog Apache Iceberg kustom untuk BigQuery mengatur metadata ke dalam hierarki berikut:

Resource Deskripsi
Project Project yang berisi resource BigQuery dan penyimpanan warehouse Cloud Storage Anda. Google Cloud
Namespace (Set Data) Set data BigQuery yang dikonfigurasi untuk bertindak sebagai namespace Iceberg, yang menentukan lokasi Cloud Storage default untuk tabel yang dibuat di dalamnya.
Tabel Tabel Apache Iceberg yang skema, snapshot, dan pointer metadatanya dilacak di BigQuery dan file datanya berada di Cloud Storage.

Membandingkan katalog Iceberg kustom dan katalog REST Iceberg

Tabel berikut merangkum perbedaan utama antara endpoint katalog Apache Iceberg kustom untuk BigQuery dan endpoint katalog REST Apache Iceberg:

Fitur Katalog Iceberg kustom untuk BigQuery Endpoint katalog REST Apache Iceberg (Direkomendasikan)
Standar Catalog API Plugin kustom (BigQueryMetastoreCatalog) Apache Iceberg REST Catalog API standar terbuka
Hierarki katalog Project > Set Data BigQuery > Tabel Project > Katalog > Namespace > Tabel (P.C.N.T)
Konfigurasi penyimpanan Jalur Cloud Storage yang ditentukan per set data atau tabel Katalog multi-bucket (bl://) atau single-bucket (gs://)
Penyediaan kredensial Tidak didukung (menggunakan kredensial IAM langsung) Didukung (menyediakan token akses penyimpanan berumur pendek)
Pemulihan dari bencana Tidak didukung Didukung (replikasi dan failover lintas-region)
Direkomendasikan untuk Deployment dan alur kerja yang ada Workload baru dan integrasi klien REST Iceberg standar

Langkah berikutnya