Ce document vous aide à résoudre les problèmes les plus courants liés à l'absence de graphiques de lignée des données dans Knowledge Catalog (anciennement Dataplex Universal Catalog). Résoudre ces problèmes vous permet de suivre correctement le déplacement des données, de comprendre leur origine et de déboguer les pipelines de données.
Types de projets
Les composants de données peuvent résider dans différents projets. Vous trouverez ci-dessous un récapitulatif des projets possibles et de leurs noms d'éléments.
Projet de stockage BigQuery
Ce projet stocke vos composants de données BigQuery.
Vous le trouverez dans les détails de l'élément, dans Table ID, avant le premier point.
Projet Compute
Ce projet stocke les métadonnées de traçabilité des données. Pour BigQuery, c'est là que vous exécutez un job. Si vous exécutez un job à l'aide de la console Google Cloud , vous pouvez trouver le nom du projet de calcul dans le sélecteur de projet :
Lorsque vous envoyez des requêtes à l'API BigQuery, spécifiez le projet de calcul dans l'URL, par exemple :
POST /bigquery/v2/projects/docs-compute/jobs HTTP/1.1
Host: bigquery.googleapis.com
User-Agent: Go-http-client/1.1
Authorization: <REDACTED 1031 BYTES>
Accept-Encoding: gzip
{
"configuration": {
"query": {
"useLegacySql": false,
"query": "CREATE OR REPLACE TABLE `docs-target.dataset.target-002` AS SELECT * FROM `docs-source.dataset.source-002`;"
}
},
"jobReference": {
"projectId": "docs-compute",
"jobId": "docs-compute-job-id",
"location": "us",
}
}
Projet actif
Il s'agit du projet à partir duquel vous consultez la traçabilité des données. La console Google Cloud affiche le projet actif dans le sélecteur de projets. Si vous utilisez l'API, le projet actif est celui à partir duquel vous effectuez des appels d'API.
La traçabilité des données BigQuery ne s'affiche pas
Le problème suivant se produit après l'exécution d'un job BigQuery. Dans ce cas, le problème peut être dû à trois scénarios :
- L'API Data Lineage est désactivée dans le projet actif ou le projet de calcul.
- Vous ne disposez pas du rôle Lecteur de la traçabilité des données (
roles/datalineage.viewer) dans le projet actif ou compute. - La traçabilité des données n'est pas encore disponible. Selon le volume et la complexité des données traitées, l'affichage de la traçabilité des données peut prendre de 30 minutes à 24 heures.
Si le message "Échec de l'extraction de la traçabilité en raison d'autorisations manquantes" s'affiche, cela signifie que vous ne disposez pas des autorisations nécessaires pour le projet actif. Sinon, vous ne disposez pas des autorisations nécessaires pour le projet de calcul.
Pour résoudre ce problème, vérifiez si l'API Data Lineage est activée pour le projet de calcul. Une fois l'API activée, vous devez exécuter un job pour afficher la traçabilité des données. Selon le volume et la complexité des données traitées, l'affichage de la traçabilité des données peut prendre de 30 minutes à 24 heures.
Ensuite, vérifiez si l'API Data Lineage est activée pour le projet actif.
Lorsque l'API Data Lineage est activée, accordez le rôle Lecteur de la traçabilité des données (roles/datalineage.viewer) dans les projets actifs et Compute.
Les métadonnées du processus BigQuery ne s'affichent pas
Le problème suivant se produit lorsque vous ouvrez le volet d'informations sur la table, qui n'affiche pas tous les détails tels que l'instruction SQL ou la propriété Process type.
Cela se produit même si la traçabilité des données s'affiche correctement.
Cela peut se produire lorsque vous n'êtes pas autorisé à afficher les métadonnées dans le projet de calcul.
Exemple :
- Table source BigQuery :
docs-source.dataset.source-001 - Table cible BigQuery :
docs-target.dataset.target-001 - Traçabilité des données entre
docs-source.dataset.source-001etdocs-target.dataset.target-001dans le projet de calculdocs-compute - Vous disposez du rôle Lecteur de la traçabilité des données pour les projets actifs et compute
docs-compute.
Si vous cliquez sur les détails du processus BigQuery, le message suivant s'affiche dans la console Google Cloud :
You don't have permission to view BigQuery process metadata in project X.
Pour résoudre ce problème, accordez à l'utilisateur l'autorisation bigquery.jobs.get (par exemple, incluse dans le rôle Lecteur de ressources BigQuery) dans le projet de calcul.
Les détails de la table BigQuery ne s'affichent pas
Le problème suivant se produit lorsque vous ouvrez le volet d'informations sur la table, qui n'affiche que la propriété Fully qualified name. Cela se produit même si la lignée de données s'affiche correctement.
Cela peut se produire lorsque vous ne disposez pas de toutes les autorisations requises dans les projets de stockage de la table.
Exemple :
- Table BigQuery
docs-source.dataset.source-001 - Table BigQuery
docs-target.dataset.target-001 - Traçabilité des données entre le
docs-source.dataset.source-001et ledocs-target.dataset.target-001avec le projet de calculdocs-compute - Vous disposez du rôle Lecteur de la traçabilité des données pour les projets actifs et compute
docs-compute.
Dans ce cas, lorsque vous cliquez sur les détails du nœud BigQuery, le message Entry with this fully qualified name is not available in Knowledge
Catalog or you do not have permissions to view it s'affiche.
Pour résoudre ce problème, accordez l'autorisation bigquery.tables.get (par exemple, incluse dans le rôle Lecteur de données BigQuery) dans le projet de stockage.
La traçabilité au niveau des colonnes affiche le message "Aucune colonne à sélectionner"
Le problème suivant se produit lorsque vous affichez un asset dans la console Google Cloud . Le graphique de traçabilité au niveau de la table s'affiche correctement, mais lorsque vous sélectionnez la traçabilité au niveau des colonnes, le message "Aucune colonne à sélectionner" s'affiche ou aucun lien de colonne à colonne n'apparaît.
Ce problème peut se produire dans les scénarios suivants :
- Événements OpenLineage personnalisés : les événements ingérés via le point de terminaison
ProcessOpenLineageRunEventde l'API Data Lineage ne sont compatibles qu'avec la traçabilité au niveau des tables. Les facettes personnalisées au niveau des colonnes ne sont pas affichées dans la consoleGoogle Cloud . - Sources de données ou systèmes non compatibles : les graphiques de traçabilité au niveau des colonnes ne sont générés que pour les transformations SQL BigQuery et les jobs Managed Service pour Apache Spark. D'autres systèmes intégrés (tels que Cloud Data Fusion et Vertex AI) ne prennent en charge que la traçabilité au niveau des tables.
- Types de jobs BigQuery non compatibles : la traçabilité au niveau des colonnes n'est pas collectée pour les jobs de chargement, les jobs de copie ni les routines BigQuery.
- Tables externes : la traçabilité en amont au niveau des colonnes n'est pas collectée pour les tables externes.
- Composants non structurés ou au niveau du stockage : bien que les composants basés sur des fichiers (tels que les fichiers ou buckets Cloud Storage bruts) ne soient généralement pas structurés, la traçabilité des données peut afficher des colonnes pour eux si la traçabilité au niveau des colonnes est signalée au système. Si la traçabilité au niveau des colonnes n'est pas indiquée pour le composant fichier, vous ne pouvez sélectionner aucune colonne.
- Types imbriqués complexes : la traçabilité au niveau des colonnes ne suit que les colonnes de premier niveau. Vous ne pouvez pas sélectionner individuellement les champs imbriqués dans des types de données complexes (tels que
STRUCTouJSON). - Pseudo-colonnes de partitionnement : les colonnes de partitionnement système (telles que
_PARTITIONDATEet_PARTITIONTIME) ne sont pas reconnues dans les graphiques de traçabilité au niveau des colonnes. - Limite de liens dépassée : si un job de transformation génère plus de 1 500 liens au niveau des colonnes, Knowledge Catalog ignore la collecte de la traçabilité au niveau des colonnes et ne conserve que la traçabilité au niveau des tables.
- Composants inter-organisations : si un chemin de traçabilité traverse un composant situé dans une autre organisation, vous ne pouvez pas accéder aux détails du schéma et des colonnes si vous n'appartenez pas à la même organisation que le composant.
Frais inattendus pour le traitement Premium de Knowledge Catalog
Vous avez désactivé l'API Dataplex (dataplex.googleapis.com) pour arrêter les frais, mais vous continuez à voir des frais quotidiens pour le SKU "Traitement premium Knowledge Catalog".
Ce problème peut se produire si l'API Data Lineage (datalineage.googleapis.com) reste activée. L'API Data Lineage est facturée sous le SKU "Traitement premium Knowledge Catalog", mais elle est gérée en tant qu'API distincte dans la console Google Cloud . La désactivation de l'API Dataplex ne désactive pas l'API Data Lineage ni n'arrête sa facturation.
Pour déterminer si la traçabilité des données est à l'origine des frais, recherchez le libellé goog-dataplex-workload-type avec la valeur LINEAGE dans votre rapport Cloud Billing.
Pour éviter ces frais, désactivez la traçabilité des données en désactivant l'API Data Lineage dans vos projets.