Comparer les types de tableaux

Choisir la bonne architecture de table est essentiel pour optimiser les performances, réduire les coûts et garantir l'accès aux données dans vos outils d'analyse. Cette page décrit les différents types de tables et les points de terminaison de diffusion disponibles dans Lakehouse pour Apache Iceberg. Elle vous aide à choisir la meilleure option en fonction de vos moteurs d'écriture, de vos exigences de lecture et de vos besoins en matière de contrôle de la gestion.

Formats de table par catalogue ou moteur

Sélectionnez un catalogue ou un moteur pour en savoir plus sur les formats de table compatibles, la configuration du metastore, les fonctionnalités d'optimisation du stockage et l'interopérabilité du moteur.

Catalogue d'environnements d'exécution Lakehouse

Le catalogue d'environnements d'exécution Lakehouse gère les tables Apache Iceberg via le point de terminaison du catalogue REST Iceberg et offre une interopérabilité en lecture/écriture fluide entre les moteurs compatibles Iceberg (Spark, Flink, Trino) et BigQuery, tout en étant soutenu par l'interface de catalogue REST Iceberg standard du secteur .

Formats de table compatibles

Les tables Apache Iceberg V2 (disponibilité générale) et V3 (bêta) sont compatibles. Les tables Iceberg V1 ne sont pas compatibles. Avant d'utiliser des tables V1 existantes avec Lakehouse pour Apache Iceberg, vous devez les mettre à niveau vers une version compatible. Pour en savoir plus, consultez Mettre à niveau les tables Iceberg V1 vers la version V2.

Principales fonctionnalités :

  • Metastore : catalogue d'environnements d'exécution Lakehouse.
  • Stockage : Cloud Storage.
  • Optimisation du stockage : gérée par vous ou, éventuellement, par Google (bêta).
  • Accès en lecture et en écriture:
    • Moteurs Open Source : lecture et écriture (disponibilité générale)
    • BigQuery : lecture/écriture (bêta)
  • Cas d'utilisation : lakehouse ouvert avec un stockage hautes performances de qualité professionnelle pour l'analyse avancée, le streaming et l'IA.

Metastore Hive

Le catalogue d'environnements d'exécution Lakehouse gère les tables Apache Hive via un point de terminaison Apache Hive Metastore (HMS) optimisé pour la compatibilité avec ExternalCatalog d'Apache Spark, ce qui vous permet de partager facilement des données entre Apache Spark, Apache Hive et BigQuery. Vous créez ces tables à partir de moteurs Open Source et les stockez dans Cloud Storage. Cette option est idéale si vous souhaitez que votre workflow ETL soit géré par des moteurs Open Source sans avoir besoin d'un metastore Hive autohébergé distinct et que vous n'ayez besoin que d'un accès en lecture depuis BigQuery.

Les tables gérées par le point de terminaison du metastore Hive sont des tables Apache Hive et Spark standards (utilisant Hive SerDes ou des sources de données Spark), et non des tables Apache Iceberg. Pour créer et gérer des tables Apache Iceberg dans le catalogue d'environnements d'exécution Lakehouse, utilisez plutôt le point de terminaison du catalogue REST Iceberg.

Principales fonctionnalités :

  • Metastore : catalogue d'environnements d'exécution Lakehouse (via IMetastoreClient personnalisé).
  • Stockage : Cloud Storage (compatible avec des formats tels que Parquet, ORC et Avro).
  • Optimisation du stockage : gérée par vous ou par un tiers.
  • Accès en lecture et en écriture:
    • Moteurs Open Source (Spark et Hive) : lecture et écriture.
    • BigQuery : lecture seule.
  • Cas d'utilisation : migration des charges de travail Spark et Hive existantes vers un metastore sans serveur entièrement géré sur Google Cloud.

BigQuery

BigQuery est compatible avec les tables gérées Apache Iceberg, les tables natives et les tables externes.

  • Tables gérées Apache Iceberg : il s'agit de tables Apache Iceberg que vous créez et gérez à partir de BigQuery et que vous stockez dans Cloud Storage. Bien qu'elles puissent être lues par des moteurs Open Source, BigQuery est le moteur qui gère les métadonnées et y écrit. Cette option est idéale si vous souhaitez que votre workflow soit entièrement géré par BigQuery.

  • Tables natives : il s'agit de tables BigQuery natives. Elles sont entièrement gérées et offrent les fonctionnalités d'analyse et de gestion les plus avancées. Cette option est idéale pour les charges de travail non Iceberg.

  • Tables externes : ces tables sont des constructions spécifiques à BigQuery pour les données stockées dans Cloud Storage, Amazon S3 ou Azure Blob Storage. Les données et les métadonnées sont autogérées, et BigQuery n'a qu'un accès en lecture. Choisissez cette option pour les données que vous souhaitez gérer directement dans un catalogue ou un stockage tiers.

Formats de table par produit

Utilisez le tableau suivant pour comparer les types de tables entre le catalogue d'environnements d'exécution Lakehouse et BigQuery.

Lakehouse

Apache Iceberg (disponibilité générale) Lakehouse multicloud (bêta) Apache Hive (bêta)
Metastore Catalogue d'environnements d'exécution Lakehouse Catalogue d'environnements d'exécution Lakehouse Catalogue d'environnements d'exécution Lakehouse
Stockage Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Optimisation du stockage Gérée par le client, par un tiers ou par Google (bêta) Gérée par le client ou par un tiers Gérée par le client ou par un tiers
Lecture/écriture Moteurs Open Source (lecture/écriture)

BigQuery (lecture/écriture [bêta])
Moteurs Open Source (lecture)

BigQuery (lecture)
Moteurs Open Source (lecture/écriture)

BigQuery (lecture seule)
Opérations avancées Aucune Aucune Aucun
Cas d'utilisation Lakehouse ouvert Interrogez des données chez d'autres fournisseurs cloud sans migrer de fichiers ni créer de pipelines ETL complexes. Migrez les charges de travail Spark et Hive existantes vers un metastore sans serveur entièrement géré,

BigQuery

Tables gérées Apache Iceberg Tables externes Tables standards
Metastore BigQuery Metastore externe ou autohébergée BigQuery
Stockage Cloud Storage Cloud Storage / Amazon S3 / Azure BigQuery
Optimisation du stockage Gérée par Google Gérée par le client ou par un tiers Gérée par Google
Lecture/écriture Moteurs Open Source (lecture seule avec les bibliothèques Iceberg, interopérabilité en lecture/écriture avec l'API BigQuery Storage)

BigQuery (lecture/écriture)

Moteurs Open Source (lecture/écriture)

BigQuery (lecture seule)
Moteurs Open Source (interopérabilité en lecture/écriture avec API BigQuery Storage)

BigQuery (lecture/écriture)

Opérations avancées Streaming à haut débit avec l'API BigQuery Storage Write, capture des données modifiées (CDC) et transactions multi-instructions Aucune Streaming à haut débit avec l'API BigQuery Storage Write, capture des données modifiées (CDC) et transactions multi-instructions
Cas d'utilisation Lakehouse ouvert avec un stockage hautes performances de qualité professionnelle pour l'analyse avancée, le streaming et l'IA Tables de préparation pour les chargements BigQuery, tables héritées en lecture seule tables Stockage de qualité professionnelle pour l'analyse avancée, le streaming et l'IA

Étape suivante