À propos du point de terminaison du catalogue Apache Iceberg personnalisé pour BigQuery

Le point de terminaison du catalogue Apache Iceberg personnalisé pour BigQuery connecte les moteurs de requête Open Source tels qu'Apache Spark et Apache Flink au catalogue d'environnements d'exécution Lakehouse. En intégrant un plug-in de catalogue personnalisé (BigQueryMetastoreCatalog), ce point de terminaison vous permet de gérer et d'interroger les métadonnées des tables Apache Iceberg directement via BigQuery, tout en stockant les fichiers de données et de métadonnées dans Cloud Storage.

Fonctionnement du catalogue Iceberg personnalisé

Le catalogue Apache Iceberg personnalisé utilise une implémentation de catalogue personnalisée (org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog) fournie dans une bibliothèque JAR. Lorsque vos charges de travail de calcul s'exécutent sur Managed Service pour Apache Spark, le moteur utilise ce plug-in pour interagir avec BigQuery en tant que magasin de métadonnées pour vos tables Apache Iceberg.

Le workflow fonctionne comme suit :

  1. Implémentation du catalogue : les moteurs de requête chargent le fichier JAR du catalogue BigQuery Metastore et configurent les propriétés du catalogue de session Spark pour utiliser org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog.
  2. Gestion des métadonnées : lorsque vous créez ou modifiez des tables à l'aide des API Spark SQL ou DataFrame, le plug-in stocke les définitions d'ensemble de données et de table dans BigQuery.
  3. Stockage des données : les fichiers de métadonnées Apache Iceberg (metadata.json, listes de manifestes, manifestes) et les fichiers de données (tels que les fichiers Parquet) sont stockés directement dans le chemin d'accès de l'entrepôt Cloud Storage que vous avez spécifié.
  4. Accès inter-moteurs : comme les métadonnées sont enregistrées dans BigQuery, vous pouvez interroger les tables à partir de moteurs Open Source tels que Spark et directement depuis BigQuery.

Hiérarchie des ressources

Le point de terminaison du catalogue Apache Iceberg personnalisé pour BigQuery organise les métadonnées selon la hiérarchie suivante :

Ressource Description
Projet Le Google Cloud projet qui contient vos ressources BigQuery et le stockage de l'entrepôt Cloud Storage.
Espace de noms (ensemble de données) Un ensemble de données BigQuery configuré pour servir d'espace de noms Iceberg, définissant l'emplacement Cloud Storage par défaut pour les tables créées dans celui-ci.
Table Une table Apache Iceberg dont le schéma, les instantanés et les pointeurs de métadonnées sont suivis dans BigQuery et dont les fichiers de données résident dans Cloud Storage.

Comparer les catalogues Iceberg personnalisés et les catalogues REST Iceberg

Le tableau suivant récapitule les principales différences entre le point de terminaison du catalogue Apache Iceberg personnalisé pour BigQuery et le point de terminaison du catalogue REST Apache Iceberg :

Fonctionnalité Catalogue Iceberg personnalisé pour BigQuery Point de terminaison du catalogue REST Apache Iceberg (recommandé)
Norme de l'API Catalog Plug-in personnalisé (BigQueryMetastoreCatalog) API de catalogue REST Apache Iceberg standard ouverte
Hiérarchie du catalogue Projet > Ensemble de données BigQuery > Table Projet > Catalogue > Espace de noms > Table (P.C.E.T)
Configuration de l'espace de stockage Chemins d'accès Cloud Storage spécifiés par ensemble de données ou par table Catalogues à plusieurs buckets (bl://) ou à un seul bucket (gs://)
Distribution d'identifiants Non compatible (utilise des identifiants IAM directs) Compatible (distribue des jetons d'accès au stockage de courte durée)
Reprise après sinistre Non compatible Compatible (réplication et basculement interrégionaux)
Recommandations pour… Déploiements et workflows existants Nouvelles charges de travail et intégrations de clients REST Iceberg standards

Étape suivante