Surveiller les journaux Knowledge Catalog

Ce document explique comment accéder aux journaux Knowledge Catalog (anciennement Dataplex Universal Catalog), les interroger et les interpréter à l'aide de Cloud Logging. L'accès aux journaux de tâches et de services Knowledge Catalog vous permet de résoudre les problèmes et de surveiller les activités de gestion des données, y compris la découverte de données basée sur l'IA et l'analyse de la qualité des données.

En centralisant les journaux dans Logging, vous pouvez analyser les performances des tâches, configurer des alertes en cas d'échec ou d'anomalie, et acheminer les journaux vers d'autres Google Cloud services tels que BigQuery pour une conservation et une analyse à long terme.

Pour comprendre les coûts, consultez la page Tarifs de Google Cloud Observability.

Pour en savoir plus sur la conservation des journaux, consultez Durée de conservation des journaux.

Pour désactiver tous les journaux ou en exclure de Logging, consultez la section Filtres d'exclusion.

Pour acheminer des journaux de Logging vers Cloud Storage, BigQuery ou Pub/Sub, consultez la présentation du routage et du stockage.

Cas d'utilisation

La journalisation de Knowledge Catalog prend en charge des cas d'utilisation dans différents secteurs :

  • Résoudre les échecs de pipeline de données : lorsqu'une tâche Knowledge Catalog de traitement des données échoue, les journaux process fournissent des messages d'erreur détaillés qui aident les ingénieurs de données à identifier et à résoudre les problèmes dans leurs tâches Spark ou personnalisées.
  • Surveiller la qualité des données : une entreprise de services financiers peut surveiller les journaux data_quality_scan_rule_result pour suivre les tendances de la qualité des données au fil du temps, recevoir des alertes en cas de dégradation de la qualité des éléments de données critiques et fournir aux auditeurs des preuves des contrôles de qualité des données pour la conformité réglementaire.
  • Suivre l'enrichissement des métadonnées : une entreprise de vente au détail qui utilise des tâches d'importation de métadonnées pour enrichir son catalogue peut utiliser les journaux metadata_job pour vérifier que les importations sont effectuées correctement et que tous les éléments de métadonnées sont traités correctement.
  • Auditer la découverte de données : les organisations peuvent utiliser les journaux discovery pour surveiller comment et quand de nouvelles sources de données sont découvertes et enregistrées dans Knowledge Catalog, ce qui fournit une piste d'audit pour les processus d'intégration des données.

Fonctionnement de la journalisation de Knowledge Catalog

Knowledge Catalog envoie des journaux pour les opérations de service et les exécutions de tâches à Cloud Logging. Chaque entrée de journal contient des informations sur l'opération ou la tâche, telles que son état, son heure de début et de fin, les ressources associées (comme une analyse de données ou une tâche) et le résultat. Différents types d'opérations, tels que l'analyse de données, la découverte, l'importation de métadonnées et le traitement des données, génèrent différents types de journaux, que vous pouvez interroger à l'aide de logName ou du langage de requête Logging dans Logging.

Vous pouvez accéder à ces journaux et les analyser à l'aide de l'explorateur de journaux dans la Google Cloud console ou en les acheminant vers d'autres destinations, telles que des buckets Cloud Storage ou des tables BigQuery, pour une analyse plus approfondie.

Types de journaux Knowledge Catalog

Knowledge Catalog publie les journaux de service suivants dans Cloud Logging.

Type de journal Nom du journal Requête logName Description du journal
Journaux des événements d'analyse des données dataplex.googleapis.com/data_scan logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdata_scan) Journaux d'événements au niveau des tâches pour les tâches d'analyse de données (analyse de la qualité des données et analyse du profil des données) indiquant l'état, les résultats et les statistiques des tâches
Journaux des résultats des règles d'analyse de la qualité des données dataplex.googleapis.com/data_quality_scan_rule_result logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdata_quality_scan_rule_result) Résultats d'évaluation détaillés au niveau des règles pour chaque règle évaluée dans une tâche d'analyse de la qualité des données
Journaux de découverte dataplex.googleapis.com/discovery logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdiscovery) Progression de la découverte et mises à jour des éléments d'une zone
Journaux sur les jobs de métadonnées dataplex.googleapis.com/metadata_job logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fmetadata_job) Journaux sur les jobs d'importation de métadonnées et les éléments d'importation dans le fichier d'importation de métadonnées
Journaux de traitement dataplex.googleapis.com/process logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fprocess) Exécutions de jobs résultant de tâches de traitement de données

Accéder aux journaux de service Knowledge Catalog

Pour accéder à Logging, utilisez l' explorateur de journaux dans la Google Cloud console, les gcloud logging commandes, ou l'API Logging. Vous pouvez utiliser le langage de requête Logging pour créer des requêtes détaillées.

Autorisations IAM requises

Pour afficher et interroger les journaux, vous devez disposer du rôle Lecteur de journaux (roles/logging.viewer) ou d'autorisations équivalentes sur le projet.

Afficher les journaux dans la Google Cloud console

  1. Dans la Google Cloud console, accédez à la page Observabilité > Logging > Explorateur de journaux.

    Accéder à l'explorateur de journaux

  2. Configurez les filtres Ressource et Nom du journal en fonction du tableau suivant :

    Type de journal Sélection de la ressource Sélection du nom du journal
    Événements d'analyse des données Ressource auditée > Service : Cloud Dataplex dataplex.googleapis.com/data_scan
    Résultats des règles d'analyse de la qualité des données Ressource auditée > Service : Cloud Dataplex dataplex.googleapis.com/data_quality_scan_rule_result
    Journaux de découverte Zone Cloud Dataplex dataplex.googleapis.com/discovery
    Journaux sur les jobs de métadonnées Job de métadonnées Cloud Dataplex dataplex.googleapis.com/metadata_job
    Journaux de traitement Tâche Cloud Dataplex dataplex.googleapis.com/process
  3. (Facultatif) Sélectionnez des sous-filtres spécifiques (tels qu'un ID de tâche spécifique) pour affiner votre requête.

  4. Cliquez sur Appliquer, puis sur Exécuter la requête.

Exemples de filtrage des journaux

Vous pouvez utiliser le langage de requête Logging dans l'éditeur de requêtes de l'explorateur de journaux ou avec Google Cloud CLI. Les exemples suivants montrent comment lire les journaux à l'aide de gcloud CLI.

Exemple : Lire les événements d'analyse des données

Pour lire les entrées de journal d'événements pour les analyses de la qualité des données ou du profil des données, utilisez la gcloud logging read commande avec la requête suivante :

gcloud logging read \
    'resource.type="dataplex.googleapis.com/DataScan" AND
    logName=projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdata_scan AND
    resource.labels.location=LOCATION AND
    resource.labels.datascan_id=DATA_SCAN_ID'
    --limit 10

Exemple : Lire les entrées de journaux de traitement

Pour lire les entrées de journaux de traitement, utilisez la gcloud logging read commande avec la requête suivante :

gcloud logging read \
    'resource.type="dataplex.googleapis.com/Task" AND
    logName=projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fprocess AND
    resource.labels.location=LOCATION AND
    resource.labels.lake_id=LAKE_ID AND
    resource.labels.task_id=TASK_ID'
    --limit 10

Exemples de charges utiles de journaux

Les exemples suivants montrent les structures de charge utile JSON pour différents types de journaux Knowledge Catalog. Vous pouvez utiliser ces exemples pour comprendre la structure des journaux et créer des filtres de journaux.

Journaux des événements d'analyse des données

Dans Knowledge Catalog, les analyses de données englobent à la fois les analyses de la qualité des données et les analyses du profil des données. Lorsque vous exécutez une tâche d'analyse de données de l'un ou l'autre type, Knowledge Catalog génère un journal d'événements data_scan dans Logging qui récapitule l'exécution globale de la tâche.

L'exemple suivant montre la charge utile du journal d'événements pour une analyse de la qualité des données :

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "dataQuality": {
      "passed": false,
      "rowsAnalyzed": "5000"
    },
    "dataSource": "//bigquery.googleapis.com/projects/my-project/datasets/my_dataset/tables/my_table"
  },
  "resource": {
    "type": "dataplex.googleapis.com/DataScan",
    "labels": {
      "datascan_id": "my-data-quality-scan",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Journaux des résultats des règles d'analyse de la qualité des données

Lorsqu'une analyse de la qualité des données est exécutée, Knowledge Catalog génère un journal d'événements d'analyse des données et un journal distinct des résultats des règles d'analyse de la qualité des données pour chaque règle évaluée dans la tâche.

Chaque entrée de journal data_quality_scan_rule_result contient des informations sur la règle spécifique, y compris la configuration de la règle, la dimension d'évaluation, l'état et le nombre de lignes.

L'exemple suivant montre une charge utile de journal des résultats des règles d'analyse de la qualité des données :

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "jobId": "my-data-quality-scan-job-123",
    "dataSource": "//bigquery.googleapis.com/projects/my-project/datasets/my_dataset/tables/my_table",
    "column": "user_id",
    "ruleName": "user-id-not-null",
    "ruleType": "NON_NULL_EXPECTATION",
    "ruleDimension": "COMPLETENESS",
    "thresholdPercent": 100,
    "result": "PASSED",
    "evaluatedRowCount": "5000",
    "passedRowCount": "5000",
    "nullRowCount": "0"
  },
  "resource": {
    "type": "dataplex.googleapis.com/DataScan",
    "labels": {
      "datascan_id": "my-data-quality-scan",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Journaux de découverte

L'exemple suivant montre une charge utile de journal de découverte :

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "message": "BigQuery table published successfully.",
    "lakeId": "my-lake",
    "zoneId": "my-zone",
    "assetId": "my-asset",
    "dataLocation": "gs://my-bucket/path/to/data",
    "type": "TABLE_PUBLISHED",
    "table": {
      "table": "projects/my-project/datasets/my_dataset/tables/my_table",
      "type": "EXTERNAL_TABLE"
    }
  },
  "resource": {
    "type": "dataplex.googleapis.com/Zone",
    "labels": {
      "lake_id": "my-lake",
      "zone_id": "my-zone",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Journaux sur les jobs de métadonnées

L'exemple suivant montre une charge utile de journal de job de métadonnées :

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "resource": "projects/my-project/locations/us-central1/metadataJobs/my-metadata-job",
    "message": "Metadata import job completed successfully.",
    "type": "IMPORT",
    "importResult": {
      "state": "SUCCEEDED",
      "stage": "INGESTION",
      "mutatedEntryGroups": "1",
      "createdEntries": "50",
      "updatedEntries": "10",
      "deletedEntries": "5"
    }
  },
  "resource": {
    "type": "dataplex.googleapis.com/MetadataJob",
    "labels": {
      "metadata_job_id": "my-metadata-job",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Journaux de traitement

L'exemple suivant montre une charge utile de journal de traitement :

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "message": "Spark job completed successfully.",
    "jobId": "my-task-job-123",
    "startTime": "2026-08-13T10:00:00Z",
    "endTime": "2026-08-13T10:05:00Z",
    "state": "SUCCEEDED",
    "type": "SPARK",
    "service": "DATAPROC",
    "serviceJob": "projects/my-project/regions/us-central1/jobs/dataproc-job-123",
    "executionTrigger": "TASK_CONFIG"
  },
  "resource": {
    "type": "dataplex.googleapis.com/Task",
    "labels": {
      "task_id": "my-task",
      "lake_id": "my-lake",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Configurer des alertes basées sur les journaux

Vous pouvez configurer des alertes basées sur les journaux pour être averti lorsque des événements Knowledge Catalog spécifiques se produisent (par exemple, en cas d'échec d'une analyse de la qualité des données).

Pour créer des alertes basées sur les journaux, vous devez disposer des rôles Rédacteur de configuration des journaux (roles/logging.configWriter) et Éditeur de Monitoring AlertPolicy (roles/monitoring.alertPolicyEditor), ou d'autorisations équivalentes.

  1. Exécutez une requête dans l'explorateur de journaux qui cible la condition d'échec (par exemple : resource.type="dataplex.googleapis.com/DataScan" AND NOT jsonPayload.dataQuality.passed=true).
  2. Au-dessus du volet des résultats de la requête, cliquez sur Créer une alerte.
  3. Dans le panneau Créer une alerte basée sur les journaux, saisissez un nom et une description pour la règle d'alerte.
  4. Cliquez sur Suivant , puis configurez vos canaux de notification.
  5. Cliquez sur Enregistrer.

Pour en savoir plus, consultez Créer des alertes basées sur les journaux.

Étape suivante