Choisir la bonne architecture de table est essentiel pour maximiser les performances, réduire les coûts et garantir l'accès aux données dans vos outils d'analyse. Cette page explique les différents types de tables et points de terminaison de diffusion disponibles dans le lakehouse sans bordure. Elle vous aide à choisir la meilleure option en fonction de vos moteurs d'écriture, de vos besoins de lecture et de vos besoins de contrôle de gestion.
Formats de tableau par catalogue ou moteur
Sélectionnez un catalogue ou un moteur pour en savoir plus sur les formats de table compatibles, la configuration du metastore, les fonctionnalités d'optimisation du stockage et l'interopérabilité du moteur.
Catalogue d'environnements d'exécution Lakehouse
Le catalogue d'environnements d'exécution Lakehouse gère les tables Apache Iceberg via le point de terminaison du catalogue REST Iceberg et offre une interopérabilité en lecture et en écriture fluide entre les moteurs compatibles avec Iceberg (Spark, Flink, Trino) et BigQuery, tout en étant basé sur l'interface de catalogue REST Iceberg, qui est une norme du secteur.
Formats de tableaux compatibles
Les tables Apache Iceberg V2 (disponibilité générale) et V3 (preview) sont compatibles. Les tables Iceberg V1 ne sont pas acceptées. Avant d'utiliser des tables V1 existantes avec Lakehouse, vous devez les mettre à niveau vers une version compatible. Pour en savoir plus, consultez Mettre à niveau les tables Iceberg V1 vers V2.
Principales fonctionnalités :
- Metastore : catalogue d'environnements d'exécution Lakehouse.
- Stockage : Cloud Storage.
- Optimisation du stockage : gérée par vous ou, en option, par Google (aperçu).
- Accès en lecture et en écriture :
- Moteurs Open Source : lecture et écriture (GA)
- BigQuery : lecture/écriture (preview)
- Cas d'utilisation : lakehouse ouvert avec stockage hautes performances de niveau entreprise pour l'analyse avancée, le streaming et l'IA.
Metastore Hive
Le catalogue d'environnements d'exécution Lakehouse gère les tables Apache Hive via un point de terminaison Apache Hive Metastore (HMS) optimisé pour la compatibilité avec Apache Spark ExternalCatalog, ce qui vous permet de partager facilement des données entre Apache Spark, Apache Hive et BigQuery. Vous créez ces tables à partir de moteurs Open Source et les stockez dans Cloud Storage. Cette option est idéale si vous souhaitez que votre workflow ETL soit géré par des moteurs Open Source sans avoir besoin d'un metastore Hive auto-hébergé distinct et que vous n'avez besoin que d'un accès en lecture depuis BigQuery.
Les tables gérées par le point de terminaison du metastore Hive sont des tables Apache Hive et Spark standards (utilisant des SerDes Hive ou des sources de données Spark), et non des tables Apache Iceberg. Pour créer et gérer des tables Apache Iceberg dans le catalogue du runtime Lakehouse, utilisez plutôt le point de terminaison du catalogue REST Iceberg.
Principales fonctionnalités :
- Metastore : catalogue d'environnements d'exécution Lakehouse (via
IMetastoreClientpersonnalisé). - Stockage : Cloud Storage (formats compatibles : Parquet, ORC et Avro, par exemple).
- Optimisation du stockage : gérée par vous ou un tiers.
- Accès en lecture et en écriture :
- Moteurs Open Source (Spark et Hive) : lecture et écriture.
- BigQuery : en lecture seule.
- Cas d'utilisation : migrer les charges de travail Spark et Hive existantes vers un metastore sans serveur entièrement géré sur Google Cloud.
Formats de tableau par produit
Utilisez le tableau suivant pour comparer les types de tables dans le catalogue d'exécution Lakehouse.
Lakehouse
| Apache Iceberg (disponibilité générale) | Accès aux données multicloud (bêta) | Apache Hive (preview) | |
|---|---|---|---|
| Metastore | Catalogue d'environnements d'exécution Lakehouse | Catalogue d'environnements d'exécution Lakehouse | Catalogue d'environnements d'exécution Lakehouse |
| Stockage | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Optimisation du stockage | Gérée par le client, par un tiers ou par Google (preview) | Gérée par le client ou un tiers | Gérée par le client ou un tiers |
| Lecture/Écriture |
Moteurs Open Source (lecture/écriture) BigQuery (lecture/écriture [aperçu]) |
Moteurs Open Source (lecture) BigQuery (lecture) |
Moteurs Open Source (lecture/écriture) BigQuery (lecture seule) |
| Opérations avancées | Aucun | Aucune | Aucun |
| Access control (Contrôle des accès) | Sécurité au niveau des tables avec IAM | Sécurité au niveau des tables avec IAM | Sécurité au niveau des tables avec IAM |
| Cas d'utilisation | Lakehouse ouvert | Interrogez les données d'autres fournisseurs de services cloud sans migrer de fichiers ni créer de pipelines ETL complexes. | Migrer les charges de travail Spark et Hive existantes vers un metastore sans serveur entièrement géré |
Fonctionnalités des tables Iceberg
Consultez le tableau suivant pour en savoir plus sur les fonctionnalités proposées dans les tables Apache Iceberg du catalogue d'environnements d'exécution Lakehouse.
| Capacité | Assistance |
|---|---|
| Catalogue | Catalogue d'environnements d'exécution Lakehouse (compatible avec le catalogue REST Iceberg) |
| Stockage | Cloud Storage |
| Accessible via le point de terminaison du catalogue REST Iceberg | Oui |
| Interopérabilité en lecture/écriture | |
| Requêtes de lecture BigQuery (SELECT, BQML, fonctions d'IA) | Compatible (disponibilité générale) |
| LMD BigQuery (INSERT, UPDATE, DELETE, MERGE) | Compatible (preview) |
| Lectures du moteur OSS | Compatible (disponibilité générale) |
| Écritures du moteur OSS | Compatible (disponibilité générale) |
| Écritures de flux de moteur OSS (Kafka, Spark, Dataflow avec le récepteur Iceberg I/O) | Compatible (disponibilité générale) |
| Fonctionnalités gérées et avancées | |
| Gestion des tables (compaction, récupération de mémoire) | Compatible (preview) |
| Fonctionnalité temporelle | |
| Fonctionnalité temporelle (avec les moteurs OSS) | Flexible (configuré via les propriétés de la table) |
| Voyage dans le temps (avec BigQuery) | Limitée à sept jours |
| Historique des instantanés et restauration d'un instantané précédent | Compatible (disponibilité générale) |
| Fonctionnalités de Knowledge Catalog | |
| Catalogage, recherche et découverte des métadonnées | Compatible (disponibilité générale) |
| Traçabilité | Compatible (disponibilité générale) |
| Qualité/profilage des données | Compatible (disponibilité générale) |
| Insights | Compatible (disponibilité générale) |
| Génération de descriptions de colonnes et de tables basée sur l'IA | Compatible (disponibilité générale) |
Étapes suivantes
Découvrez comment gérer les tables Apache Iceberg.
Découvrez comment importer des tables Iceberg externes à l'aide de Dataflow.