Utiliser Knowledge Catalog avec BigQuery

Knowledge Catalog (anciennement Dataplex Universal Catalog) interagit avec BigQuery en tant que couche centrale de gouvernance des données et d'accès par agent pour les métadonnées de BigQuery. Pour en savoir plus, consultez la présentation de Knowledge Catalog.

Comment utiliser Knowledge Catalog avec BigQuery ?

Knowledge Catalog interagit avec BigQuery de la manière suivante.

Ingestion automatisée des métadonnées

Knowledge Catalog détecte et indexe automatiquement les métadonnées techniques des éléments BigQuery. Parmi lesquels :

Représentation et enrichissement des métadonnées

  • Entrées : chaque table ou élément BigQuery est représenté sous forme d'une entrée dans le catalogue, plutôt que sous forme de table entière (par exemple, project.dataset.table).
  • Intégration du tableau de bord de la qualité des données : Knowledge Catalog fournit un tableau de bord de la qualité des données pour chaque entrée du catalogue. En plus des analyses de données intégrées à Knowledge Catalog, les résultats d'assertion de Dataform sont une source pour ce tableau de bord (preview).
  • Enrichissement automatisé des métadonnées : pour les tables et les vues créées avec Dataform, vous pouvez définir des métadonnées sémantiques directement dans votre code. Ces métadonnées sont automatiquement synchronisées avec Knowledge Catalog une fois l'action de pipeline terminée (preview). Les types d'aspects suivants sont acceptés :

    • Présentation : documentation et texte récapitulatif de l'entrée.
    • Aspects génériques : tags de métadonnées sémantiques pour les détails techniques, tels que les informations sur le système et le type de table.

    Pour vérifier l'état d'une mise à jour des métadonnées, suivez les instructions de la section Afficher les exécutions manuelles passées.

    Une fois les métadonnées synchronisées, vous pouvez rechercher et afficher l'entrée dans Knowledge Catalog. Pour en savoir plus, consultez la section Rechercher des ressources.

  • Métadonnées au niveau des colonnes : les colonnes ou champs individuels sont représentés sous forme de chemins, ce qui vous permet d'associer des métadonnées spécifiques, telles que des marqueurs d'informations personnelles ou des scores de qualité des données, à des champs individuels d'une table BigQuery plutôt qu'à la table elle-même.

  • Aspects : les métadonnées techniques sont enrichies avec des aspects, qui ajoutent un contexte métier aux données, comme la propriété, la qualité des données et la documentation.

  • Produits de données : vous pouvez regrouper des éléments BigQuery associés dans des produits de données (par exemple, des données commerciales sur le commerce électronique), qui partagent des contraintes d'accès et de gouvernance.

  • Recherche sémantique : les utilisateurs peuvent utiliser le langage naturel pour rechercher des données BigQuery, ce qui est particulièrement utile aux data scientists et aux agents d'IA pour trouver des produits de données fiables à l'aide de requêtes longues ou complexes.
  • Traduction des noms : pour faciliter la recherche programmatique le système permet de traduire les noms SQL BigQuery, ou noms complets, en noms d'entrée Knowledge Catalog.

Accès par agent et ancrage

  • Accès par agent : les agents d'IA peuvent découvrir et utiliser de manière adaptative les outils Knowledge Catalog via un serveur MCP local ou distant.
  • Contexte pour les agents d'IA : Knowledge Catalog organise un graphique de contexte qui associe les ensembles de données BigQuery à la sémantique métier, ce qui permet de réduire les hallucinations de l'IA en s'assurant que les modèles utilisent des données approuvées par l'entreprise.

Gouvernance et conformité

  • Traçabilité des données : Knowledge Catalog suit automatiquement le flux et la transformation des données dans les tables BigQuery. Cette fonctionnalité est essentielle pour auditer les informations sensibles, telles que les informations personnelles, dans l'ensemble du patrimoine de données.
  • Contrôle des accès : la gestion des métadonnées est intégrée à Identity and Access Management (IAM) et VPC Service Controls pour garantir que la découverte et l'accès aux métadonnées BigQuery respectent les stratégies de sécurité de l'organisation.

Considérations sur la migration

La migration vers Knowledge Catalog à partir de Data Catalog, qui est obsolète, implique plusieurs étapes. Les métadonnées standards de BigQuery (telles que les ensembles de données, les tables et les vues) sont automatiquement disponibles dans Knowledge Catalog. Le processus de migration se concentre donc principalement sur les métadonnées personnalisées, l'utilisation de l'API et les paramètres par défaut de l'interface utilisateur.

Voici les principaux points à prendre en compte lors de la migration.

Comprendre la modification

Knowledge Catalog offre des fonctionnalités améliorées pour la gestion, la gouvernance et la découverte des métadonnées par rapport à Data Catalog. Knowledge Catalog utilise une API différente (l'API Knowledge Catalog) et un modèle de données légèrement différent. Par exemple, Knowledge Catalog utilise des aspects et des types d'aspects au lieu de tags et de modèles de tags.

Évaluer l'utilisation actuelle de Data Catalog

  • Aucune métadonnée personnalisée : si vous n'avez utilisé Knowledge Catalog que pour l'ingestion et la découverte automatiques de métadonnées BigQuery standards sans créer de tags, de modèles de tags, d'entrées personnalisées ni de groupes d'entrées, la transition est simple. Vous pouvez commencer à utiliser l'interface Knowledge Catalog immédiatement.
  • Métadonnées personnalisées ou utilisation programmatique : si vous avez créé des tags ou des modèles personnalisés, des entrées personnalisées, ou si vous utilisez l'API Data Catalog, des bibliothèques clientes, des commandes Google Cloud CLI ou Terraform, vous avez besoin d'une transition plus structurée.

Considérations spécifiques à BigQuery

  • Ingestion automatique : les métadonnées techniques des éléments BigQuery (ensembles de données, tables, vues, modèles et routines) continuent d'être ingérées automatiquement dans Knowledge Catalog, comme c'était le cas avec Dataplex Universal Catalog.
  • Tags avec stratégie : les tags avec stratégie utilisés pour le contrôle des accès au niveau des colonnes de BigQuery ne sont pas obsolètes et leur gestion reste dans BigQuery.
  • Traçabilité : la traçabilité des données pour les opérations BigQuery est présentée dans Knowledge Catalog. Pour en savoir plus sur la traçabilité des données, consultez la section Suivre la traçabilité des données pour une table BigQuery.

Suivre le guide de transition

Pour migrer vers Knowledge Catalog, suivez les étapes décrites dans la section Passer de Data Catalog à Knowledge Catalog.

Pour mettre à jour les workflows programmatiques vers l'API Knowledge Catalog, consultez la section Mapper les méthodes de l'API Data Catalog à Knowledge Catalog.

Étape suivante

En savoir plus sur Knowledge Catalog :