Knowledge Catalog-Logs überwachen

In diesem Dokument wird erläutert, wie Sie mit Cloud Logging auf Knowledge Catalog-Logs (ehemals Dataplex Universal Catalog) zugreifen, sie abfragen und interpretieren. Wenn Sie auf Knowledge Catalog-Job- und Dienstlogs zugreifen, können Sie Probleme beheben und Datenverwaltungsaktivitäten überwachen, einschließlich KI-gestützter Datenermittlung und Datenqualitätsscans.

Durch die Zentralisierung von Logs in Logging können Sie die Jobleistung analysieren, Benachrichtigungen für Fehler oder Anomalien einrichten und Logs zur langfristigen Aufbewahrung und Analyse an andere Google Cloud Dienste wie BigQuery weiterleiten.

Informationen zu den Kosten finden Sie unter Google Cloud Observability – Preise.

Weitere Informationen zur Aufbewahrung von Logs finden Sie unter Aufbewahrungsdauer von Logs.

Informationen zum Deaktivieren aller Logs oder zum Ausschließen von Logs aus Logging finden Sie unter Ausschlussfilter.

Informationen zum Weiterleiten von Logs von Logging an Cloud Storage, BigQuery oder Pub/Sub finden Sie unter Übersicht: Routing und Speicher.

Anwendungsfälle

Knowledge Catalog-Logging unterstützt Anwendungsfälle in verschiedenen Branchen:

  • Fehlerbehebung bei Datenpipelinefehlern:Wenn eine Knowledge Catalog-Aufgabe zur Datenverarbeitung fehlschlägt, liefern process-Logs detaillierte Fehlermeldungen, mit denen Datenanalysten Probleme in ihren Spark-Jobs oder benutzerdefinierten Aufgaben identifizieren und beheben können.
  • Datenqualität überwachen:Ein Finanzdienstleistungsunternehmen kann data_quality_scan_rule_result-Logs verwenden, um Trends bei der Datenqualität im Zeitverlauf zu verfolgen, Benachrichtigungen bei Qualitätsverschlechterungen für kritische Daten-Assets zu erhalten und Prüfern Nachweise für Datenqualitätsprüfungen zur Einhaltung gesetzlicher Vorschriften zu liefern.
  • Metadatenanreicherung verfolgen:Ein Einzelhandelsunternehmen, das Metadatenimportjobs verwendet, um seinen Katalog anzureichern, kann metadata_job-Logs verwenden, um zu prüfen, ob Importe erfolgreich abgeschlossen werden und alle Metadatenelemente korrekt verarbeitet werden.
  • Datenermittlung prüfen:Unternehmen können discovery-Logs verwenden, um zu überwachen, wie und wann neue Datenquellen in Knowledge Catalog ermittelt und registriert werden. So erhalten sie einen Prüfpfad für Daten-Onboarding-Prozesse.

So funktioniert das Knowledge Catalog-Logging

Knowledge Catalog sendet Logs für Dienstvorgänge und Jobausführungen an Cloud Logging. Jeder Logeintrag enthält Details zum Vorgang oder Job, z. B. Status, Start- und Endzeit, zugehörige Ressourcen (z. B. ein Datenscan oder eine Aufgabe) und Ergebnis. Verschiedene Arten von Vorgängen wie Datenscans, Ermittlung, Metadatenimport und Datenverarbeitung generieren unterschiedliche Logtypen, die Sie mit logName oder der Logging-Abfragesprache in Logging abfragen können.

Sie können mit dem Log-Explorer in der Google Cloud Console auf diese Logs zugreifen und sie analysieren oder sie zur weiteren Analyse an andere Ziele wie Cloud Storage-Buckets oder BigQuery-Tabellen weiterleiten.

Knowledge Catalog-Logtypen

Knowledge Catalog veröffentlicht die folgenden Dienstlogs in Cloud Logging.

Logtyp Log name logName-Abfrage Logbeschreibung
Ereignislogs für Datenscans dataplex.googleapis.com/data_scan logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdata_scan) Ereignislogs auf Jobebene für Datenscan-Jobs (sowohl Datenqualitäts- als auch Datenprofilscans) mit Jobstatus, Ergebnissen und Statistiken
Logs zu Ergebnissen von Datenqualitätsregeln dataplex.googleapis.com/data_quality_scan_rule_result logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdata_quality_scan_rule_result) Detaillierte Auswertungsergebnisse auf Regelebene für jede Regel, die in einem Datenqualitäts-Scanjob ausgewertet wurde
Ermittlungsprotokolle dataplex.googleapis.com/discovery logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdiscovery) Ermittlungsfortschritt und Updates zu Assets in einer Zone
Metadatenjob-Logs dataplex.googleapis.com/metadata_job logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fmetadata_job) Logs zu Metadatenimportjobs und Importelementen in der Metadatenimportdatei
Protokolle verarbeiten dataplex.googleapis.com/process logName=(projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fprocess) Jobausführungen, die aus Datenverarbeitungsaufgaben resultieren

Auf Knowledge Catalog-Dienstlogs zugreifen

Sie können mit dem Log-Explorer in der Google Cloud Console, den gcloud logging Befehlen oder der Logging API auf Logging zugreifen. Mit der Logging-Abfragesprache können Sie detaillierte Abfragen erstellen.

Erforderliche IAM-Berechtigungen

Zum Ansehen und Abfragen von Logs benötigen Sie die Rolle „Log-Anzeige“ (roles/logging.viewer) oder entsprechende Berechtigungen für das Projekt.

Logs in der Google Cloud Console ansehen

  1. Rufen Sie in der Google Cloud Console die Seite Observability > Logging > Log-Explorer auf.

    Zum Log-Explorer

  2. Konfigurieren Sie die Filter Ressource und Logname anhand der folgenden Tabelle:

    Logtyp Ressourcenauswahl Logname-Auswahl
    Ereignisse für Datenscans Geprüfte Ressource > Dienst: Cloud Dataplex dataplex.googleapis.com/data_scan
    Ergebnisse von Datenqualitätsregeln Geprüfte Ressource > Dienst: Cloud Dataplex dataplex.googleapis.com/data_quality_scan_rule_result
    Ermittlungsprotokolle Cloud Dataplex-Zone dataplex.googleapis.com/discovery
    Metadatenjob-Logs Metadatenjob in Cloud Dataplex dataplex.googleapis.com/metadata_job
    Protokolle verarbeiten Cloud Dataplex-Aufgabe dataplex.googleapis.com/process
  3. (Optional) Wählen Sie bestimmte Unterfilter aus (z. B. eine bestimmte Aufgaben-ID), um die Abfrage einzugrenzen.

  4. Klicken Sie auf Anwenden und dann auf Abfrage ausführen.

Beispiele für die Logfilterung

Sie können die Logging-Abfragesprache im Abfrageeditor des Log-Explorers oder mit der Google Cloud CLI verwenden. Die folgenden Beispiele zeigen, wie Sie Logs mit der gcloud CLI lesen.

Beispiel: Ereignisse für Datenscans lesen

Verwenden Sie den gcloud logging read Befehl mit der folgenden Abfrage, um Ereignislogeinträge für Datenqualitäts- oder Datenprofilscans zu lesen:

gcloud logging read \
    'resource.type="dataplex.googleapis.com/DataScan" AND
    logName=projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fdata_scan AND
    resource.labels.location=LOCATION AND
    resource.labels.datascan_id=DATA_SCAN_ID'
    --limit 10

Beispiel: Protokolleinträge verarbeiten

Verwenden Sie den gcloud logging read Befehl mit der folgenden Abfrage, um Protokolleinträge zu lesen:

gcloud logging read \
    'resource.type="dataplex.googleapis.com/Task" AND
    logName=projects/PROJECT_ID/logs/dataplex.googleapis.com%2Fprocess AND
    resource.labels.location=LOCATION AND
    resource.labels.lake_id=LAKE_ID AND
    resource.labels.task_id=TASK_ID'
    --limit 10

Beispielnutzlasten für Logs

Die folgenden Beispiele zeigen die JSON-Nutzlaststrukturen für verschiedene Arten von Knowledge Catalog-Logs. Anhand dieser Beispiele können Sie die Struktur der Logs nachvollziehen und Logfilter erstellen.

Ereignislogs für Datenscans

In Knowledge Catalog umfassen Datenscans sowohl Datenqualitäts- als auch Datenprofilscans. Wenn Sie einen Datenscanjob eines der beiden Typen ausführen, erstellt Knowledge Catalog ein data_scan-Ereignislog in Logging, in dem die gesamte Jobausführung zusammengefasst wird.

Das folgende Beispiel zeigt die Nutzlast des Ereignislogs für einen Datenqualitätsscan:

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "dataQuality": {
      "passed": false,
      "rowsAnalyzed": "5000"
    },
    "dataSource": "//bigquery.googleapis.com/projects/my-project/datasets/my_dataset/tables/my_table"
  },
  "resource": {
    "type": "dataplex.googleapis.com/DataScan",
    "labels": {
      "datascan_id": "my-data-quality-scan",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Logs zu Ergebnissen von Datenqualitätsregeln

Wenn ein Datenqualitätsscan ausgeführt wird, generiert Knowledge Catalog ein Ereignislog für den Datenscan und ein separates Log mit den Ergebnissen der Datenqualitätsregeln für jede einzelne Regel, die im Job ausgewertet wird.

Jeder data_quality_scan_rule_result-Logeintrag enthält Informationen zur jeweiligen Regel, einschließlich der Regelkonfiguration, der Auswertungsdimension, des Status und der Zeilenanzahl.

Das folgende Beispiel zeigt eine Nutzlast für ein Log mit den Ergebnissen der Datenqualitätsregeln:

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "jobId": "my-data-quality-scan-job-123",
    "dataSource": "//bigquery.googleapis.com/projects/my-project/datasets/my_dataset/tables/my_table",
    "column": "user_id",
    "ruleName": "user-id-not-null",
    "ruleType": "NON_NULL_EXPECTATION",
    "ruleDimension": "COMPLETENESS",
    "thresholdPercent": 100,
    "result": "PASSED",
    "evaluatedRowCount": "5000",
    "passedRowCount": "5000",
    "nullRowCount": "0"
  },
  "resource": {
    "type": "dataplex.googleapis.com/DataScan",
    "labels": {
      "datascan_id": "my-data-quality-scan",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Ermittlungsprotokolle

Das folgende Beispiel zeigt eine Nutzlast für ein Ermittlungsprotokoll:

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "message": "BigQuery table published successfully.",
    "lakeId": "my-lake",
    "zoneId": "my-zone",
    "assetId": "my-asset",
    "dataLocation": "gs://my-bucket/path/to/data",
    "type": "TABLE_PUBLISHED",
    "table": {
      "table": "projects/my-project/datasets/my_dataset/tables/my_table",
      "type": "EXTERNAL_TABLE"
    }
  },
  "resource": {
    "type": "dataplex.googleapis.com/Zone",
    "labels": {
      "lake_id": "my-lake",
      "zone_id": "my-zone",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Metadatenjob-Logs

Das folgende Beispiel zeigt eine Nutzlast für ein Metadatenjob-Log:

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "resource": "projects/my-project/locations/us-central1/metadataJobs/my-metadata-job",
    "message": "Metadata import job completed successfully.",
    "type": "IMPORT",
    "importResult": {
      "state": "SUCCEEDED",
      "stage": "INGESTION",
      "mutatedEntryGroups": "1",
      "createdEntries": "50",
      "updatedEntries": "10",
      "deletedEntries": "5"
    }
  },
  "resource": {
    "type": "dataplex.googleapis.com/MetadataJob",
    "labels": {
      "metadata_job_id": "my-metadata-job",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Protokolle verarbeiten

Das folgende Beispiel zeigt eine Nutzlast für ein Verarbeitungsprotokoll:

{
  "insertId": "123456abcdef",
  "jsonPayload": {
    "message": "Spark job completed successfully.",
    "jobId": "my-task-job-123",
    "startTime": "2026-08-13T10:00:00Z",
    "endTime": "2026-08-13T10:05:00Z",
    "state": "SUCCEEDED",
    "type": "SPARK",
    "service": "DATAPROC",
    "serviceJob": "projects/my-project/regions/us-central1/jobs/dataproc-job-123",
    "executionTrigger": "TASK_CONFIG"
  },
  "resource": {
    "type": "dataplex.googleapis.com/Task",
    "labels": {
      "task_id": "my-task",
      "lake_id": "my-lake",
      "location": "us-central1",
      "resource_container": "projects/1234567890"
    }
  },
  "severity": "INFO"
}

Logbasierte Benachrichtigungen einrichten

Sie können logbasierte Benachrichtigungen einrichten, um benachrichtigt zu werden, wenn bestimmte Knowledge Catalog-Ereignisse eintreten (z. B. ein fehlgeschlagener Datenqualitätsscan).

Zum Erstellen logbasierter Benachrichtigungen benötigen Sie die Rollen „Logkonfigurationsschreiber“ (roles/logging.configWriter) und „Bearbeiter von Monitoring-Benachrichtigungsrichtlinien“ (roles/monitoring.alertPolicyEditor) oder entsprechende Berechtigungen.

  1. Führen Sie im Log-Explorer eine Abfrage aus, die auf die Fehlerbedingung abzielt (z. B.: resource.type="dataplex.googleapis.com/DataScan" AND NOT jsonPayload.dataQuality.passed=true).
  2. Klicken Sie über dem Bereich mit den Abfrageergebnissen auf Benachrichtigung erstellen.
  3. Geben Sie im Bereich Logbasierte Benachrichtigung erstellen einen Namen und eine Beschreibung für die Benachrichtigungsrichtlinie ein.
  4. Klicken Sie auf Weiter und konfigurieren Sie die Benachrichtigungskanäle.
  5. Klicken Sie auf Speichern.

Weitere Informationen finden Sie unter Logbasierte Benachrichtigungen erstellen.

Nächste Schritte