Importer des données depuis des catalogues Iceberg externes vers un Lakehouse sans bordures à l'aide de Dataflow

Votre cas d'utilisation peut vous obliger à connecter une table de catalogue REST Iceberg (IRC) externe à une table Lakehouse existante. L'UI du générateur de jobs Dataflow vous permet de créer un pipeline qui migre vos tables de catalogue Iceberg Open Source externes vers Lakehouse de manière low code ou no code. Ce processus vous permet de consolider les données dans un format Iceberg géré par Lakehouse unifié pour l'analyse multi-moteurs.

Utilisez les informations de connexion suivantes pour importer des données à partir de catalogues Iceberg externes.

Une fois votre tableau importé, vous pouvez importer périodiquement les données de modification pour synchroniser les mises à jour du tableau source avec le tableau Lakehouse. Pour en savoir plus, consultez Migrer les données de capture des données modifiées (CDC) Apache Iceberg vers un Lakehouse sans frontières à l'aide de Dataflow.

Avant de commencer

Pour importer des données, vous avez besoin des éléments suivants :

  1. Informations de connexion pour le catalogue REST Iceberg externe. Par exemple : nom du catalogue, espace de noms, nom de la table, URI du compte et rôle permettant d'accéder au catalogue.
  2. Un catalogue, un espace de noms et une table Lakehouse Iceberg pour importer les données.

Compatibilité et limites

L'importation de données depuis des catalogues Iceberg externes vers Lakehouse à l'aide de Dataflow présente les limites suivantes :

  • Cette fonctionnalité permet de lire les données des fournisseurs Iceberg disponibles en externe et compatibles avec IRC (Iceberg Rest Catalog) dans Lakehouse. Les autres types de catalogues Iceberg ne sont pas acceptés.
  • Cette fonctionnalité est compatible avec les pipelines de traitement par lot et par flux.

Importer une table de catalogue Iceberg externe

Pour importer une table de catalogue Iceberg externe dans Lakehouse, procédez comme suit :

  1. Dans la console Google Cloud , accédez à la page Catalogue d'environnements d'exécution Lakehouse.

    Accéder au catalogue d'environnements d'exécution Lakehouse

  2. Sélectionnez le catalogue, l'espace de noms et la table dans lesquels vous souhaitez importer des données.

  3. Sur la page Détails de la table, cliquez sur Importer une table, puis sélectionnez Depuis un catalogue REST Apache Iceberg (lot).

    La page Job Builder Dataflow s'ouvre.

  4. Dans la section Sources :

    1. Pour développer le panneau source Table Iceberg, cliquez sur la flèche de développement .

    2. Dans le champ Table Iceberg, saisissez l'identifiant de la table Apache Iceberg.

    3. Dans le champ Nom du catalogue, saisissez le nom du catalogue.

    4. Dans le champ Filtre, saisissez le filtre Iceberg à utiliser. Exemple : id > 5.

    5. Facultatif : Pour spécifier les modifications apportées aux colonnes de la table source, utilisez les sections Conserver les colonnes ou Supprimer les colonnes.

    6. Dans la liste Type de catalogue de la section Propriétés du catalogue, sélectionnez le type de catalogue.

    7. Dans le champ URI du catalogue, saisissez l'URI du catalogue. Exemple : http://localhost:8181.

    8. Dans le champ Nom de l'entrepôt, saisissez le nom du catalogue.

      Pour certains fournisseurs de catalogues REST Iceberg externes, l'entrepôt est abstrait et le nom du catalogue est fourni en tant que nom de l'entrepôt.

    9. Dans la liste Type d'authentification, sélectionnez le type d'authentification. Exemple : OAUTH2.

  5. Facultatif : Dans la section Transformations, ajoutez des transformations aux données sources.

  6. Dans la section Récepteur :

    1. Facultatif : Examinez le panneau du récepteur Table Lakehouse. Les informations de ce panneau, telles que la table Lakehouse, le nom du catalogue et l'emplacement de l'entrepôt, sont généralement préremplies.
  7. Dans la section Options Dataflow, cliquez sur Exécuter le job.

Étapes suivantes