Comparer les types de tableaux

Choisir la bonne architecture de table est essentiel pour maximiser les performances, réduire les coûts et garantir l'accès aux données dans vos outils d'analyse. Cette page explique les différents types de tables et points de terminaison de diffusion disponibles dans le lakehouse sans bordure. Elle vous aide à choisir la meilleure option en fonction de vos moteurs d'écriture, de vos besoins de lecture et de vos besoins de contrôle de gestion.

Formats de tableau par catalogue ou moteur

Sélectionnez un catalogue ou un moteur pour en savoir plus sur les formats de table compatibles, la configuration du metastore, les fonctionnalités d'optimisation du stockage et l'interopérabilité du moteur.

Catalogue d'environnements d'exécution Lakehouse

Le catalogue d'environnements d'exécution Lakehouse gère les tables Apache Iceberg via le point de terminaison du catalogue REST Iceberg et offre une interopérabilité en lecture et en écriture fluide entre les moteurs compatibles avec Iceberg (Spark, Flink, Trino) et BigQuery, tout en étant basé sur l'interface de catalogue REST Iceberg, qui est une norme du secteur.

Formats de tableaux compatibles

Les tables Apache Iceberg V2 (disponibilité générale) et V3 (preview) sont compatibles. Les tables Iceberg V1 ne sont pas acceptées. Avant d'utiliser des tables V1 existantes avec Lakehouse, vous devez les mettre à niveau vers une version compatible. Pour en savoir plus, consultez Mettre à niveau les tables Iceberg V1 vers V2.

Principales fonctionnalités :

  • Metastore : catalogue d'environnements d'exécution Lakehouse.
  • Stockage : Cloud Storage.
  • Optimisation du stockage : gérée par vous ou, en option, par Google (aperçu).
  • Accès en lecture et en écriture :
    • Moteurs Open Source : lecture et écriture (GA)
    • BigQuery : lecture/écriture (preview)
  • Cas d'utilisation : lakehouse ouvert avec stockage hautes performances de niveau entreprise pour l'analyse avancée, le streaming et l'IA.

Metastore Hive

Le catalogue d'environnements d'exécution Lakehouse gère les tables Apache Hive via un point de terminaison Apache Hive Metastore (HMS) optimisé pour la compatibilité avec Apache Spark ExternalCatalog, ce qui vous permet de partager facilement des données entre Apache Spark, Apache Hive et BigQuery. Vous créez ces tables à partir de moteurs Open Source et les stockez dans Cloud Storage. Cette option est idéale si vous souhaitez que votre workflow ETL soit géré par des moteurs Open Source sans avoir besoin d'un metastore Hive auto-hébergé distinct et que vous n'avez besoin que d'un accès en lecture depuis BigQuery.

Les tables gérées par le point de terminaison du metastore Hive sont des tables Apache Hive et Spark standards (utilisant des SerDes Hive ou des sources de données Spark), et non des tables Apache Iceberg. Pour créer et gérer des tables Apache Iceberg dans le catalogue du runtime Lakehouse, utilisez plutôt le point de terminaison du catalogue REST Iceberg.

Principales fonctionnalités :

  • Metastore : catalogue d'environnements d'exécution Lakehouse (via IMetastoreClient personnalisé).
  • Stockage : Cloud Storage (formats compatibles : Parquet, ORC et Avro, par exemple).
  • Optimisation du stockage : gérée par vous ou un tiers.
  • Accès en lecture et en écriture :
    • Moteurs Open Source (Spark et Hive) : lecture et écriture.
    • BigQuery : en lecture seule.
  • Cas d'utilisation : migrer les charges de travail Spark et Hive existantes vers un metastore sans serveur entièrement géré sur Google Cloud.

Formats de tableau par produit

Utilisez le tableau suivant pour comparer les types de tables dans le catalogue d'exécution Lakehouse.

Lakehouse

Apache Iceberg (disponibilité générale) Accès aux données multicloud (bêta) Apache Hive (preview)
Metastore Catalogue d'environnements d'exécution Lakehouse Catalogue d'environnements d'exécution Lakehouse Catalogue d'environnements d'exécution Lakehouse
Stockage Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Optimisation du stockage Gérée par le client, par un tiers ou par Google (preview) Gérée par le client ou un tiers Gérée par le client ou un tiers
Lecture/Écriture Moteurs Open Source (lecture/écriture)

BigQuery (lecture/écriture [aperçu])
Moteurs Open Source (lecture)

BigQuery (lecture)
Moteurs Open Source (lecture/écriture)

BigQuery (lecture seule)
Opérations avancées Aucun Aucune Aucun
Access control (Contrôle des accès) Sécurité au niveau des tables avec IAM Sécurité au niveau des tables avec IAM Sécurité au niveau des tables avec IAM
Cas d'utilisation Lakehouse ouvert Interrogez les données d'autres fournisseurs de services cloud sans migrer de fichiers ni créer de pipelines ETL complexes. Migrer les charges de travail Spark et Hive existantes vers un metastore sans serveur entièrement géré

Fonctionnalités des tables Iceberg

Consultez le tableau suivant pour en savoir plus sur les fonctionnalités proposées dans les tables Apache Iceberg du catalogue d'environnements d'exécution Lakehouse.

Capacité Assistance
Catalogue Catalogue d'environnements d'exécution Lakehouse (compatible avec le catalogue REST Iceberg)
Stockage Cloud Storage
Accessible via le point de terminaison du catalogue REST Iceberg Oui
Interopérabilité en lecture/écriture
Requêtes de lecture BigQuery (SELECT, BQML, fonctions d'IA) Compatible (disponibilité générale)
LMD BigQuery (INSERT, UPDATE, DELETE, MERGE) Compatible (preview)
Lectures du moteur OSS Compatible (disponibilité générale)
Écritures du moteur OSS Compatible (disponibilité générale)
Écritures de flux de moteur OSS (Kafka, Spark, Dataflow avec le récepteur Iceberg I/O) Compatible (disponibilité générale)
Fonctionnalités gérées et avancées
Gestion des tables (compaction, récupération de mémoire) Compatible (preview)
Fonctionnalité temporelle
Fonctionnalité temporelle (avec les moteurs OSS) Flexible (configuré via les propriétés de la table)
Voyage dans le temps (avec BigQuery) Limitée à sept jours
Historique des instantanés et restauration d'un instantané précédent Compatible (disponibilité générale)
Fonctionnalités de Knowledge Catalog
Catalogage, recherche et découverte des métadonnées Compatible (disponibilité générale)
Traçabilité Compatible (disponibilité générale)
Qualité/profilage des données Compatible (disponibilité générale)
Insights Compatible (disponibilité générale)
Génération de descriptions de colonnes et de tables basée sur l'IA Compatible (disponibilité générale)

Étapes suivantes