Établir un contexte de données de base avec Knowledge Catalog

Lorsque vous travaillez avec des données, vous vous êtes probablement posé des questions telles que "Que signifie ce nom de colonne ?", "À qui appartient cet ensemble de données défectueux ?" ou "Cette table est-elle approuvée pour l'utilisation ?" Les tags de métadonnées tentent de répondre à ces questions, mais ils deviennent rapidement obsolètes ou incohérents. Knowledge Catalog (anciennement Dataplex Universal Catalog) résout ce problème en vous permettant d'associer des métadonnées structurées et des définitions métier claires directement aux éléments de données. Fournir un contexte de données clair ancre les agents d'IA et établit une base de confiance pour chaque utilisateur qui interagit avec les données.

Ce tutoriel vous explique comment établir le contexte des données dans Knowledge Catalog. Conçu pour les utilisateurs tels que les responsables des données et les analystes métier, ce tutoriel vous guide à travers les étapes basées sur l'UI pour créer des termes et un contexte métier standards avant d'automatiser ces workflows. Ce tutoriel clarifie les relations entre les concepts clés du Knowledge Catalog. À la fin de ce cours, vous saurez comment rendre vos données détectables et fiables.

Objectifs

Dans ce tutoriel, vous allez apprendre à effectuer les opérations suivantes :

  • Créez une source unique de référence pour les termes métier à l'aide d'un glossaire d'entreprise.
  • Structurez et organisez les métadonnées avec les types d'aspect.
  • Associez des métadonnées à des éléments de données à l'aide d'aspects.
  • Utilisez la recherche Knowledge Catalog pour trouver exactement ce dont vous avez besoin à l'aide de ces nouvelles métadonnées structurées.

Avant de commencer

Avant de commencer, procédez comme suit :

Configurer votre environnement

Ce tutoriel utilise Cloud Shell, un environnement de ligne de commande qui s'exécute dans le cloud.

  1. Dans la console Google Cloud , cliquez sur Activer Cloud Shell dans la barre d'outils en haut à droite. Le provisionnement et la connexion à l'environnement prennent quelques instants.

  2. Dans Cloud Shell, définissez vos variables PROJECT_ID et LOCATION afin que toutes les commandes futures ciblent votre projet Google Cloud spécifique.

    export PROJECT_ID=$(gcloud config get-value project)
    gcloud config set project $PROJECT_ID
    export LOCATION="us-central1"
    
  3. Activez les services Google Cloud nécessaires.

    gcloud services enable \
      dataplex.googleapis.com \
      bigquery.googleapis.com \
      datacatalog.googleapis.com
    

Créer un ensemble de données BigQuery et préparer des exemples de données

Utilisez le code suivant pour créer un ensemble de données BigQuery et charger des exemples de transactions CSV dans une table. Une fois la table créée, Knowledge Catalog la détecte et crée une entrée pour elle dans le catalogue.

Considérez une entrée comme la représentation d'un élément de données dans Knowledge Catalog. Il s'agit d'un enregistrement dans le catalogue auquel vous pouvez associer des métadonnées. Au lieu d'ajouter du contexte à la table BigQuery (ou de l'enrichir) directement, vous l'ajoutez à son entrée dans Knowledge Catalog.

# Create the BigQuery Dataset in the us-central1 region
bq --location=$LOCATION mk --dataset \
    --description "Sample retail data for foundational data context tutorial" \
    $PROJECT_ID:retail_data

# Create a temporary CSV file with the sample data
echo "transaction_id,user_email,gmv,transaction_date
1001,test@example.com,150.50,2025-08-28
1002,user@example.com,75.00,2025-08-28" > /tmp/transactions.csv

# Load the data from the temporary CSV file into a BigQuery table
bq load \
    --source_format=CSV \
    --autodetect \
    retail_data.transactions \
    /tmp/transactions.csv

# (Optional) Clean up the temporary file
rm /tmp/transactions.csv

Exécutez une requête SELECT pour vérifier votre configuration :

bq query --nouse_legacy_sql "SELECT * FROM retail_data.transactions"

Exemple de résultat :

+----------------+------------------+-------+------------------+
| transaction_id |    user_email    |  gmv  | transaction_date |
+----------------+------------------+-------+------------------+
|           1001 | test@example.com | 150.5 |       2025-08-28 |
|           1002 | user@example.com |  75.0 |       2025-08-28 |
+----------------+------------------+-------+------------------+

Établir des termes communs avec un glossaire d'entreprise

Un bon contexte de données repose sur des définitions claires. Par exemple, un développeur ne devrait pas avoir à deviner si une colonne nommée gmv signifie "Valeur marchande brute" ou si elle inclut les taxes et les retours. Un glossaire d'entreprise crée une source unique et fiable pour ces définitions dans toute votre organisation. Lorsque des coéquipiers ou des agents d'IA analysent vos données, ils héritent de ce contexte métier précis. Des définitions partagées permettent d'aligner les métriques entre les équipes (finances, ventes, opérations, etc.) et d'aider les agents IA à éviter les hallucinations.

Pour créer un glossaire et définir votre premier terme :

  1. Dans la console Google Cloud , accédez à la page Glossaires de Knowledge Catalog.

    Accéder à Glossaires

  2. Cliquez sur Créer un glossaire d'entreprise.

  3. Saisissez les informations suivantes :

    • Display name (Nom à afficher) : Retail Business Glossary
    • Emplacement : us-central1 (Iowa)
  4. Cliquez sur Créer.

  5. Cliquez sur Créer une catégorie.

  6. Nommez la catégorie Sales Metrics, puis cliquez sur Créer.

  7. Sélectionnez la catégorie Métriques sur les ventes, puis cliquez sur Ajouter un terme.

  8. Nommez le terme Gross Merchandise Value, puis cliquez sur Créer.

  9. Cliquez sur le terme Valeur brute des marchandises pour ouvrir la page d'informations correspondante.

  10. Cliquez sur Ajouter à côté de Vue d'ensemble. Saisissez les informations suivantes : The total value of merchandise sold over a given period of time before the deduction of any fees or expenses. This is a key indicator of e-commerce business growth.

  11. Cliquez sur Enregistrer.

Vous avez créé un terme de glossaire que vous pouvez associer à des entrées de données dans toute votre organisation.

Définir des métadonnées techniques avec un type d'aspect

Lorsque vous utilisez des tags de métadonnées non structurées, vous obtenez souvent des entrées de catalogue incohérentes. Par exemple, un tableau peut être tagué owner:bob et un autre steward:alice@example.com. Pour organiser vos métadonnées à grande échelle, vous avez besoin d'un schéma cohérent.

C'est là qu'interviennent les types d'aspect. Un type d'aspect est un plan de métadonnées qui vous permet de définir des règles claires et des champs obligatoires. En exigeant des champs standards tels que des adresses e-mail valides pour les responsables des données, les scripts en aval peuvent valider et protéger automatiquement vos métadonnées.

Pour créer un type d'aspect :

  1. Dans la console Google Cloud , accédez à l'onglet Types d'aspects de la page Types de métadonnées de Knowledge Catalog.

    Accéder à "Types d'aspect"

  2. Dans l'onglet Personnalisé, cliquez sur Créer.

  3. Saisissez les informations suivantes :

    • Display name (Nom à afficher) : Data Asset Context
    • Emplacement : us-central1 (Iowa)
  4. Dans la section Modèle, cliquez sur Ajouter un champ pour créer les trois champs suivants :

    • Champ 1 :

      • Display name (Nom à afficher) : Data Steward
      • Type : Text
      • Obligatoire : cochez la case.
      • Type de texte : Plain text
    • Champ 2 (cliquez sur Ajouter un champ) :

      • Display name (Nom à afficher) : Data Sensitivity
      • Type : Enum
      • Obligatoire : laissez la valeur "Facultatif".
      • Valeurs : ajoutez Public, Internal et Confidential.
    • Champ 3 (cliquez sur Ajouter un champ) :

      • Display name (Nom à afficher) : Last Review Date
      • Obligatoire : laissez la valeur "Facultatif".
      • Type : Date and time
  5. Cliquez sur Enregistrer.

Vous disposez désormais d'un type d'aspect pour les champs de métadonnées liés à la gouvernance des données, tels que le responsable des données, le niveau de sensibilité et la date d'examen. Dans la section suivante, vous appliquerez ce schéma à une entrée de table en associant un aspect avec des valeurs spécifiques pour ces champs.

Enrichir une entrée avec un contexte technique et commercial

Les noms de colonnes sont souvent abrégés ou ambigus. Associer une colonne à un terme de votre glossaire d'entreprise permet de fournir une définition claire et cohérente. Dans cette étape, vous allez enrichir l'entrée de la table retail_data.transactions en associant le terme Gross Merchandise Value à une colonne nommée gmv et en ajoutant un aspect à l'entrée de la table à l'aide de votre type d'aspect.

Pour clarifier la colonne gmv dans retail_data.transactions, associez-la à votre terme Gross Merchandise Value.

  1. Dans la console Google Cloud , accédez à la page Rechercher de Knowledge Catalog.

    Accéder à la recherche

  2. Cliquez sur Filtres pour ouvrir le panneau Filtres.

  3. Pour Champ d'application, sélectionnez Projet actuel.

  4. Recherchez retail_data.transactions et cliquez sur le tableau des transactions renvoyées.

  5. Cliquez sur l'onglet Schéma.

  6. Cochez la case à côté de la colonne gmv, puis cliquez sur Ajouter un terme commercial.

  7. Sélectionnez Gross Merchandise Value.

Associer un aspect à l'entrée du tableau

En plus d'associer des termes commerciaux à des colonnes, vous pouvez joindre un aspect à une entrée de tableau pour capturer les métadonnées au niveau du tableau, telles que la propriété et la sensibilité des données.

Un aspect est une instance d'un type d'aspect, avec des valeurs spécifiques pour les champs de métadonnées. Lorsque vous associez un aspect à une entrée, Knowledge Catalog vérifie la cohérence des informations que vous fournissez par rapport au schéma défini dans le type d'aspect.

Pour définir la propriété et la sensibilité de la table retail_data.transactions, associez l'aspect Data Asset Context :

  1. Dans l'onglet Détails de la page d'entrée retail_data.transactions, cliquez sur Ajouter à côté de Aspects facultatifs.
  2. Sélectionnez Data Asset Context dans la liste.
  3. Saisissez les valeurs dans les champs suivants :

    • Responsable des données : finance-team@example.com
    • Sensibilité des données : sélectionnez Interne.
    • Date de la dernière révision : sélectionnez la date du jour.
  4. Cliquez sur Enregistrer.

En enrichissant vos exemples de données de transactions commerciales, vous avez établi une base solide de contexte de données dans Knowledge Catalog.

Rechercher des entrées à l'aide de métadonnées enrichies

Vous pouvez désormais utiliser la recherche Knowledge Catalog pour trouver des entrées en fonction du contexte métier que vous avez configuré. Par exemple, vous pouvez trouver tous les composants ayant un niveau de sensibilité spécifique ou rechercher un terme de votre glossaire pour découvrir les tables sous-jacentes.

  1. Dans la console Google Cloud , accédez à la page Rechercher de Knowledge Catalog.

    Accéder à la recherche

  2. Cliquez sur Filtres pour ouvrir le panneau Filtres.

  3. Pour Champ d'application, sélectionnez Projet actuel.

  4. Dans la barre de recherche, saisissez Find tables where the Data Asset Context aspect has Internal sensitivity..

  5. Votre table retail_data.transactions devrait s'afficher dans la liste des résultats.

  6. Effacez le contenu de la barre de recherche et saisissez Find tables with the Gross Merchandise Value term attached..

  7. Le tableau retail_data.transactions devrait à nouveau s'afficher dans les résultats, car sa colonne gmv est directement associée à ce terme métier.

Lorsque vous connectez un agent d'IA à Knowledge Catalog, il hérite automatiquement de ces métadonnées enrichies. Par exemple, lorsque vous demandez à un agent de récupérer des métriques de ventes internes, il lit l'aspect "Sensibilité des données" (que vous avez défini sur "Interne") et le terme de glossaire "Valeur brute des marchandises" associé. Ce contexte partagé aide l'agent à vérifier ses sources de données, à respecter les règles d'accès et à éviter les hallucinations.

Effectuer un nettoyage

Pour éviter que des frais ne vous soient facturés, supprimez les ressources que vous avez créées dans ce tutoriel.

Supprimer l'ensemble de données exemple

Pour supprimer l'exemple d'ensemble de données BigQuery et toutes ses tables, utilisez la commande suivante. Cette action est irréversible.

# Re-run these exports if your Cloud Shell session timed out
export PROJECT_ID=$(gcloud config get-value project)

# Manually type this command to confirm you are deleting the correct dataset
bq rm -r -f --dataset $PROJECT_ID:retail_data

Supprimer des artefacts Knowledge Catalog

  1. Dans la console Google Cloud , accédez à l'onglet Types d'aspects de la page Types de métadonnées de Knowledge Catalog.

    Accéder à "Types d'aspects"

  2. Sélectionnez le type d'aspect Data Asset Context, puis cliquez sur Supprimer.

  3. Dans la console Google Cloud , accédez à la page Glossaires de Knowledge Catalog.

    Accéder à Glossaires

  4. Sélectionnez le terme Gross Merchandise Value, puis cliquez sur Supprimer.

  5. Sélectionnez la catégorie Sales Metrics, puis cliquez sur Supprimer.

  6. Sélectionnez Retail Business Glossary, puis cliquez sur Supprimer.

Étapes suivantes

Pour en savoir plus sur la curation de catalogues et la création d'agents avec Knowledge Catalog, consultez les ressources suivantes :