Ce document répond à certaines des questions fréquentes concernant Knowledge Catalog (anciennement Dataplex Universal Catalog).
Pour en savoir plus sur Knowledge Catalog, consultez la présentation de Knowledge Catalog.
Qu'est-ce que Knowledge Catalog ?
Google Knowledge Catalog est une solution de gouvernance intelligente pour les composants de données et d'IA dans Google Cloud. Il fournit un inventaire centralisé où vous pouvez découvrir, gérer et gouverner vos données dans des sources de données Google Cloud telles que BigQuery, Cloud Storage, Pub/Sub et Spanner. Il utilise l'IA pour automatiser la découverte des données, l'enrichissement des métadonnées et la qualité des données. Grâce à son catalogue de données régies, Knowledge Catalog fournit l'ancrage essentiel dont les agents d'IA ont besoin pour générer des contenus de haute qualité.
Qu'est-ce que Data Catalog ?
Data Catalog était le nom d'origine du service de métadonnées de Google Cloud. Au fil du temps, il est devenu Dataplex Universal Catalog, puis a été renommé et transformé en Knowledge Catalog.
Bien que le terme "Data Catalog" soit toujours utilisé pour décrire ce type d'indexation de données, dans le contexte de Google Cloud, il fait référence à notre ancien produit. Nous recommandons d'utiliser Knowledge Catalog pour tous les nouveaux projets afin de profiter des fonctionnalités optimisées par l'IA et d'une gouvernance améliorée.
Knowledge Catalog est-il différent de Data Catalog ?
Oui, Knowledge Catalog est une plate-forme de gouvernance des données optimisée par l'IA qui remplacera à terme Data Catalog. Bien qu'ils partagent des concepts similaires, Knowledge Catalog offre plusieurs améliorations :
Contexte optimisé par l'IA : contrairement au catalogue de données, Knowledge Catalog utilise Gemini pour extraire automatiquement le contexte métier, générer des descriptions en langage naturel et fournir des "requêtes d'or" SQL pour ancrer les agents IA.
Prise en charge des métadonnées enrichies : Knowledge Catalog est compatible avec des types de métadonnées plus complexes, tels que les tableaux, les cartes et les enregistrements imbriqués.
Accès agentique : les agents IA peuvent découvrir et utiliser de manière adaptative les outils du catalogue de connaissances via un serveur MCP local ou distant.
Découverte des données : Knowledge Catalog peut ingérer automatiquement les métadonnées d'un plus grand nombre de services Google Cloud et de sources de données externes.
Gouvernance à grande échelle : il offre des fonctionnalités améliorées pour le profilage des données, la qualité automatique des données et la gouvernance centralisée.
À quoi sert Knowledge Catalog ?
Google Knowledge Catalog résout le problème du "démarrage à froid des données", c'est-à-dire le temps perdu à essayer de trouver, de comprendre et de faire confiance aux données avant de pouvoir les utiliser réellement. Voici ses principales utilisations :
Découverte accélérée des données : au lieu de parcourir des silos organisationnels complexes pour localiser les données, vous pouvez utiliser la recherche en langage naturel (par exemple, "Affiche-moi les données les plus récentes sur le taux de perte de clients") pour trouver instantanément des composants dans les ressourcesGoogle Cloud , ce qui augmente la productivité des consommateurs de données.
Ancrage des agents d'IA : il sert de "source de référence" pour l'IA générative ou l'ADK. En associant les données physiques aux définitions métier, vous vous assurez que les agents d'IA (comme ceux basés sur Vertex AI) utilisent des données de haute qualité, ce qui réduit considérablement les hallucinations de l'IA et améliore la confiance dans les insights générés par l'IA.
Gouvernance des données automatisée : elle analyse automatiquement vos données pour identifier les informations sensibles (comme les informations permettant d'identifier personnellement l'utilisateur), suit l'origine des données (traçabilité) et surveille leur précision (qualité automatique des données). Ces fonctionnalités permettent d'améliorer la confiance, la sécurité et la conformité des données en déployant un minimum d'effort.
Découverte des "données obscures" : il peut analyser des fichiers non structurés (comme des PDF ou des images dans Cloud Storage), extraire les informations qu'ils contiennent et les rendre consultables et interrogeables dans BigQuery. Vous pouvez ainsi obtenir des insights à partir de données qui étaient auparavant inaccessibles.
Pour des cas d'utilisation pratiques, consultez Explorer Knowledge Catalog.
Quels types de métadonnées Knowledge Catalog stocke-t-il ?
Knowledge Catalog stocke trois types de métadonnées :
Métadonnées techniques : schémas, noms de tables et propriétés système collectés automatiquement.
Métadonnées métier : contexte défini par l'utilisateur, comme les descriptions métier, les termes du glossaire et la propriété.
Métadonnées d'exécution : informations sur la traçabilité des données, les scores de qualité des données et les statistiques de profilage des données.
Comment migrer depuis Data Catalog ?
La transition vers Knowledge Catalog est conçue pour être fluide, sans nécessiter de déplacement manuel des données. En fonction de votre utilisation actuelle, le processus comporte deux phases principales :
Phase préparatoire : si vous disposez de métadonnées personnalisées (tags, modèles de tags ou entrées personnalisées), ce contenu est automatiquement importé dans Knowledge Catalog en lecture seule. Au cours de cette phase, vous effectuez des tâches de configuration pour rendre votre contenu Data Catalog existant simultanément disponible dans la nouvelle interface.
Phase de transfert : une fois vos métadonnées préparées, vous transférez leur état actif pour les rendre accessibles en lecture et en écriture dans Knowledge Catalog. Cette étape doit être coordonnée avec la mise à jour des charges de travail programmatiques (API, bibliothèques clientes ou modules Terraform) pour qu'elles pointent vers les nouveaux points de terminaison Knowledge Catalog.
Si vous n'avez pas de métadonnées personnalisées ou si vous êtes un nouvel utilisateur de la plate-forme, vous pouvez effectuer la transition en définissant Knowledge Catalog comme UI par défaut dans la console Google Cloud .
Pour en savoir plus, consultez Passer de Data Catalog à Knowledge Catalog.