Informazioni sull'endpoint del catalogo Apache Iceberg personalizzato per BigQuery

L'endpoint del catalogo Apache Iceberg personalizzato per BigQuery connette motori di query open source come Apache Spark e Apache Flink al catalogo runtime lakehouse. Integrando un plug-in del catalogo personalizzato (BigQueryMetastoreCatalog), questo endpoint consente di gestire ed eseguire query sui metadati delle tabelle Apache Iceberg direttamente tramite BigQuery, archiviando al contempo i file di dati e metadati in Cloud Storage.

Come funziona il catalogo Iceberg personalizzato

Il catalogo Apache Iceberg personalizzato utilizza un'implementazione del catalogo personalizzata (org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog) fornita in una libreria JAR. Quando i carichi di lavoro di calcolo vengono eseguiti su Managed Service for Apache Spark, il motore utilizza questo plug-in per interagire con BigQuery come archivio di metadati per le tabelle Apache Iceberg.

Il flusso di lavoro funziona nel seguente modo:

  1. Implementazione del catalogo: i motori di query caricano il JAR del catalogo BigQuery Metastore e configurano le proprietà del catalogo della sessione Spark per utilizzare org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog.
  2. Gestione dei metadati: quando crei o modifichi le tabelle utilizzando le API Spark SQL o DataFrame, il plug-in archivia le definizioni di set di dati e tabelle in BigQuery.
  3. Archiviazione dei dati: i file di metadati di Apache Iceberg (metadata.json, elenchi di manifest, manifest) e i file di dati (come i file Parquet) vengono archiviati direttamente nel percorso del data warehouse Cloud Storage specificato.
  4. Accesso tra motori: poiché i metadati sono registrati in BigQuery, puoi eseguire query sulle tabelle sia da motori open source come Spark sia direttamente da BigQuery.

Gerarchia delle risorse

L'endpoint del catalogo Apache Iceberg personalizzato per BigQuery organizza i metadati nella seguente gerarchia:

Risorsa Descrizione
Progetto Il Google Cloud progetto che contiene le risorse BigQuery e lo spazio di archiviazione del data warehouse Cloud Storage.
Spazio dei nomi (set di dati) Un set di dati BigQuery configurato per fungere da spazio dei nomi Iceberg, che definisce la località Cloud Storage predefinita per le tabelle create al suo interno.
Tabella Una tabella Apache Iceberg il cui schema, snapshot e puntatori di metadati vengono monitorati in BigQuery e i cui file di dati risiedono in Cloud Storage.

Confronto tra cataloghi Iceberg personalizzati e cataloghi REST Iceberg

La seguente tabella riassume le principali differenze tra l'endpoint del catalogo Apache Iceberg personalizzato per BigQuery e l'endpoint del catalogo REST Apache Iceberg:

Funzionalità Catalogo Iceberg personalizzato per BigQuery Endpoint del catalogo REST Apache Iceberg (consigliato)
Standard API del catalogo Plug-in personalizzato (BigQueryMetastoreCatalog) API del catalogo REST Apache Iceberg standard aperto
Gerarchia del catalogo Progetto > Set di dati BigQuery > Tabella Progetto > Catalogo > Spazio dei nomi > Tabella (P.C.N.T)
Configurazione dello spazio di archiviazione Percorsi Cloud Storage specificati per set di dati o tabella Cataloghi multi-bucket (bl://) o single-bucket (gs://)
Distribuzione delle credenziali Non supportata (utilizza le credenziali IAM dirette) Supportata (distribuisce token di accesso allo spazio di archiviazione di breve durata)
Disaster recovery Non supportata Supportata (replica e failover tra regioni)
Consigliata per Deployment e workflow esistenti Nuovi carichi di lavoro e integrazioni client REST Iceberg standard

Passaggi successivi