Datenqualität analysieren und validieren

In dieser Kurzanleitung wird beschrieben, wie Sie mit Knowledge Catalog (früher Dataplex Universal Catalog) ein Profil einer BigQuery-Tabelle erstellen, Datenqualitätsregeln basierend auf Profilinformationen definieren und einen Datenqualitätsscan ausführen.

Führen Sie die folgenden Schritte aus:

  1. Erstellen Sie ein BigQuery-Dataset und eine Tabelle mit Beispieldaten zum Bikesharing, die absichtliche Anomalien wie Duplikate und Nullwerte enthalten, um die Scanfunktionen zu testen.
  2. Erstellen Sie einen Datenprofilscan für die Tabelle und führen Sie ihn aus. Beim Datenprofiling werden Statistiken auf Spaltenebene berechnet, z. B. Nullprozentsätze, Anzahl eindeutiger Werte und Werteverteilungen. Weitere Informationen finden Sie unter Datenprofilerstellung.
  3. Sehen Sie sich die Ergebnisse des Datenprofilscans an, um Muster und potenzielle Anomalien zu finden.
  4. Definieren Sie Datenqualitätsregeln basierend auf den Profilergebnissen und führen Sie einen Datenqualitätsscan aus. Bei Datenqualitätsscans werden Ihre Daten anhand definierter Regeln validiert, um Anomalien zu erkennen. Weitere Informationen finden Sie unter Automatische Datenqualität.
  5. Sehen Sie sich die Bewertungsergebnisse an, um zu sehen, welche Qualitätsregeln bestanden oder fehlgeschlagen sind.

Hinweis

So richten Sie Ihr Projekt ein:

  1. Melden Sie sich in Ihrem Google Cloud -Konto an. Wenn Sie mit Google Cloudnoch nicht vertraut sind, erstellen Sie ein Konto, um die Leistungsfähigkeit unserer Produkte in der Praxis sehen und bewerten zu können. Neukunden erhalten außerdem ein Guthaben von 300 $, um Arbeitslasten auszuführen, zu testen und bereitzustellen.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.

  4. Verify that billing is enabled for your Google Cloud project.

  5. Enable the Knowledge Catalog and BigQuery APIs.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the APIs

  6. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  7. If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.

  8. Verify that billing is enabled for your Google Cloud project.

  9. Enable the Knowledge Catalog and BigQuery APIs.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the APIs

Erforderliche Rollen

Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen für das Projekt zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Erstellen und Ausführen von Datenprofil- und Datenqualitäts-Scans sowie zum Verwalten von BigQuery-Ressourcen benötigen:

Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.

Wenn Sie die erforderlichen Berechtigungen zum Verwalten des IAM-Zugriffs in Ihrem Projekt haben, können Sie diese Rollen Ihrem eigenen Nutzerkonto zuweisen, indem Sie die folgenden gcloud-Befehle ausführen:

gcloud projects add-iam-policy-binding PROJECT_ID \
    --member="user:USER_EMAIL" \
    --role="roles/dataplex.dataScanEditor"

gcloud projects add-iam-policy-binding PROJECT_ID \
    --member="user:USER_EMAIL" \
    --role="roles/bigquery.dataOwner"

gcloud projects add-iam-policy-binding PROJECT_ID \
    --member="user:USER_EMAIL" \
    --role="roles/bigquery.jobUser"

Ersetzen Sie Folgendes:

  • PROJECT_ID: Projekt-ID in Google Cloud .
  • USER_EMAIL: Die E-Mail-Adresse Ihres Nutzerkontos, z. B. name@example.com.

Berechtigungen für den Knowledge Catalog-Dienst-Agent erteilen

Ein Dienst-Agent ist ein von Google verwaltetes Dienstkonto, das von Knowledge Catalog verwendet wird, um in Ihrem Namen Scanabfragen in BigQuery auszuführen.

  1. Klicken Sie in der Google Cloud Console in der Symbolleiste auf Cloud Shell aktivieren. Die Bereitstellung und Verbindung mit der Umgebung dauert einen kleinen Moment.

  2. Knowledge Catalog-Dienst-Agent erstellen:

    gcloud beta services identity create --service=dataplex.googleapis.com
    

    Mit diesem Befehl wird der Dienst-Agent erstellt, falls er noch nicht bereitgestellt wurde, und seine E-Mail-Adresse wird ausgegeben. Wenn Ihr Projekt bereits einen Dienst-Agent für den Knowledge Catalog hat, gibt der Befehl die vorhandene Identität zurück, ohne Änderungen vorzunehmen.

    Die Ausgabe sieht etwa so aus:

    serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com
    

    Notieren Sie sich die PROJECT_NUMBER in der Ausgabe für die nächsten Schritte.

  3. Weisen Sie die Rolle BigQuery Job User (roles/bigquery.jobUser) zu, damit Knowledge Catalog Abfragejobs in Ihrem Projekt ausführen kann:

    gcloud projects add-iam-policy-binding PROJECT_ID \
       --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com" \
       --role="roles/bigquery.jobUser"
    

    Ersetzen Sie Folgendes:

    • PROJECT_ID: Projekt-ID in Google Cloud .
    • PROJECT_NUMBER: Ihre Google Cloud Projektnummer
  4. Weisen Sie die Rolle BigQuery-Datenbetrachter (roles/bigquery.dataViewer) zu, damit der Service-Agent Ihre Tabellendaten und Ihr Schema lesen kann:

    gcloud projects add-iam-policy-binding PROJECT_ID \
       --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com" \
       --role="roles/bigquery.dataViewer"
    

    Ersetzen Sie Folgendes:

    • PROJECT_ID: Projekt-ID in Google Cloud .
    • PROJECT_NUMBER: Ihre Google Cloud Projektnummer

Beispieldataset und ‑tabelle erstellen

Wenn Sie Profiling und Datenqualitätsprüfungen gefahrlos ausprobieren möchten, ohne Produktionsdaten zu verwenden, richten Sie ein separates BigQuery-Dataset ein und erstellen Sie direkt in Ihrem Projekt eine Tabelle mit Beispieldaten.

Console

  1. Rufen Sie in der Google Cloud Console die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im Bereich Explorer neben Ihrer Projekt-ID auf Aktionen ansehen und dann auf Dataset erstellen.

  3. Geben Sie im Feld Dataset-ID den Wert quickstart_data_profile ein.

  4. Wählen Sie in der Liste Datenspeicherort die Option us-central1 (Iowa) aus.

  5. Klicken Sie auf Dataset erstellen.

  6. Geben Sie im Abfrageeditor die folgende SQL-Abfrage ein, um Beispieldaten für Bikesharing in Ihrer Tabelle bikeshare_trips zu generieren:

    CREATE OR REPLACE TABLE `PROJECT_ID.quickstart_data_profile.bikeshare_trips` AS
    SELECT
    -- Duplicate and null IDs
    IF(MOD(x, 100) = 0, NULL, IF(x > 9900, 1000 + (x - 9900), 1000 + x)) AS trip_id,
    -- Nulls and unrecognized category values
    CASE
      WHEN MOD(x, 50) = 0 THEN 'INVALID_TIER'
      WHEN MOD(x, 25) = 0 THEN NULL
      WHEN MOD(x, 4) = 0 THEN 'Local Rider'
      WHEN MOD(x, 4) = 1 THEN 'Walk Up'
      WHEN MOD(x, 4) = 2 THEN 'Student Membership'
      ELSE 'Weekender'
    END AS subscriber_type,
    -- Nulls and malformed bike IDs
    CASE
      WHEN MOD(x, 60) = 0 THEN 'UNKNOWN'
      WHEN MOD(x, 30) = 0 THEN NULL
      ELSE CAST(2000 + x AS STRING)
    END AS bike_id,
    -- Null dates and future timestamps
    CASE
      WHEN MOD(x, 70) = 0 THEN NULL
      WHEN MOD(x, 40) = 0 THEN TIMESTAMP_ADD(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
      ELSE TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
    END AS start_time,
    -- Nulls and placeholder station values
    CASE
      WHEN MOD(x, 20) = 0 THEN 'STATION_UNKNOWN'
      WHEN MOD(x, 10) = 0 THEN NULL
      ELSE CAST(100 + MOD(x, 50) AS STRING)
    END AS start_station_id,
    -- Negative durations, zeros, and extreme outliers
    CASE
      WHEN MOD(x, 15) = 0 THEN -10.0
      WHEN MOD(x, 35) = 0 THEN 0.0
      WHEN MOD(x, 200) = 0 THEN 99999.0
      ELSE CAST(MOD(x, 120) + 1.5 AS FLOAT64)
    END AS duration_minutes
    FROM UNNEST(GENERATE_ARRAY(1, 10000)) AS x;

    Ersetzen Sie PROJECT_ID durch Ihre Google Cloud Projekt-ID.

  7. Klicken Sie auf Ausführen.

gcloud

  1. Erstellen Sie in Cloud Shell das Dataset quickstart_data_profile in der Region us-central1:

    bq --location=us-central1 mk --dataset PROJECT_ID:quickstart_data_profile
    

    Ersetzen Sie PROJECT_ID durch IhreGoogle Cloud Projekt-ID.

  2. Erstellen Sie die Beispieltabelle bikeshare_trips und füllen Sie sie:

    bq query \
    --use_legacy_sql=false \
    "CREATE OR REPLACE TABLE \`PROJECT_ID.quickstart_data_profile.bikeshare_trips\` AS
    SELECT
      IF(MOD(x, 100) = 0, NULL, IF(x > 9900, 1000 + (x - 9900), 1000 + x)) AS trip_id,
      CASE
        WHEN MOD(x, 50) = 0 THEN 'INVALID_TIER'
        WHEN MOD(x, 25) = 0 THEN NULL
        WHEN MOD(x, 4) = 0 THEN 'Local Rider'
        WHEN MOD(x, 4) = 1 THEN 'Walk Up'
        WHEN MOD(x, 4) = 2 THEN 'Student Membership'
        ELSE 'Weekender'
      END AS subscriber_type,
      CASE
        WHEN MOD(x, 60) = 0 THEN 'UNKNOWN'
        WHEN MOD(x, 30) = 0 THEN NULL
        ELSE CAST(2000 + x AS STRING)
      END AS bike_id,
      CASE
        WHEN MOD(x, 70) = 0 THEN NULL
        WHEN MOD(x, 40) = 0 THEN TIMESTAMP_ADD(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
        ELSE TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
      END AS start_time,
      CASE
        WHEN MOD(x, 20) = 0 THEN 'STATION_UNKNOWN'
        WHEN MOD(x, 10) = 0 THEN NULL
        ELSE CAST(100 + MOD(x, 50) AS STRING)
      END AS start_station_id,
      CASE
        WHEN MOD(x, 15) = 0 THEN -10.0
        WHEN MOD(x, 35) = 0 THEN 0.0
        WHEN MOD(x, 200) = 0 THEN 99999.0
        ELSE CAST(MOD(x, 120) + 1.5 AS FLOAT64)
      END AS duration_minutes
    FROM UNNEST(GENERATE_ARRAY(1, 10000)) AS x;"
    

Datenprofilscan erstellen und ausführen

Bei einem Datenprofilscan werden die Zeilen Ihrer Tabelle analysiert, um statistische Informationen zu berechnen, z. B. die Anzahl eindeutiger Werte, das Verhältnis von Nullwerten und die Bereiche der Datenverteilung.

Console

  1. Rufen Sie in der Google Cloud Console die Seite Datenprofilerstellung und ‑qualität auf.

    Zu „Datenprofilerstellung und ‑qualität“

  2. Klicken Sie auf Datenprofilscan erstellen.

  3. Lassen Sie unter Typ auswählen die Option Datenprofilscan ausgewählt.

  4. Geben Sie unter Allgemein im Feld Anzeigename bikeshare-trips-profile ein.

  5. Klicken Sie unter Zu scannende Tabelle im Feld Tabelle auf Durchsuchen, wählen Sie die Tabelle quickstart_data_profile.bikeshare_trips in Ihrem Projekt aus und klicken Sie dann auf Auswählen.

  6. Wählen Sie für Mode (Modus) die Option Standard aus.

  7. Wählen Sie unter Umfang die Option Gesamte Daten aus.

  8. Wählen Sie für Zeitplan die Option Auf Abruf aus.

  9. Übernehmen Sie für die restlichen Einstellungen die Standardwerte.

  10. Klicken Sie auf Scan ausführen.

    Der Scanjob wird gestartet. Es dauert in der Regel 3 bis 5 Minuten, bis Knowledge Catalog den Scan ausführt und Statistiken für Ihre Tabelle berechnet.

gcloud

  1. Erstellen Sie den Datenprofilscan in Cloud Shell:

    gcloud dataplex datascans create data-profile bikeshare-trips-profile \
     --location=us-central1 \
     --data-source-resource="//bigquery.googleapis.com/projects/PROJECT_ID/datasets/quickstart_data_profile/tables/bikeshare_trips" \
     --description="Data profile scan for sample bikeshare dataset"
    

    Ersetzen Sie PROJECT_ID durch IhreGoogle Cloud Projekt-ID.

  2. Führen Sie den Datenprofilscan aus:

    gcloud dataplex datascans run bikeshare-trips-profile \
     --location=us-central1
    

    Der Scanvorgang wird im Hintergrund gestartet. Der Scan dauert in der Regel 3 bis 5 Minuten.

Ergebnisse des Datenprofilscans ansehen

Sehen Sie sich nach Abschluss des Scans die Spaltenstatistiken an, um die Merkmale Ihrer Daten zu verstehen.

  1. Rufen Sie in der Google Cloud Console die Seite Datenprofilerstellung und ‑qualität auf.

    Zu „Datenprofilerstellung und ‑qualität“

  2. Klicken Sie in der Liste der Scans auf bikeshare-trips-profile.

  3. Wenn der Scan noch nicht ausgeführt wurde, klicken Sie auf Jetzt ausführen.

  4. Warten Sie im Bereich Übersicht, bis für den letzten Scanvorgang Erfolgreich angezeigt wird.

    Das folgende Bild zeigt den Scanjob im Bereich Übersicht mit dem Status Erfolgreich:

    Übersichtsbereich des Profilscans für Bikesharing-Fahrten mit dem Jobstatus „Erfolgreich“ und dem Link „Ergebnisse ansehen“.

  5. Sehen Sie sich die Scanergebnisse an, um die Datenverteilung Ihrer Tabelle zu verstehen und potenzielle Ziele für die Datenqualitätsvalidierung zu ermitteln. Auf dem Tab Letzte Job-Ergebnisse werden in Knowledge Catalog Messwerte auf Spaltenebene angezeigt, darunter Null %, Anzahl und Prozentsatz der eindeutigen Werte, Höchste Werte und Zusammenfassende Statistiken.

    In der folgenden Tabelle sehen Sie, welchen Profilmesswert Sie für jede Tabellenspalte prüfen sollten, wie Sie die Ergebnisse interpretieren und auf welche Datenqualitätsregel Sie sich konzentrieren sollten:

    Tabellenspalte Messwert für Profilergebnisse Worauf Sie achten sollten und wie Sie die Daten interpretieren Ziel der Datenqualitätsvalidierung
    duration_minutes Zusammenfassende Statistiken Negative Werte erkannt: Der Min-Wert beträgt -10.0 Minuten. Die verstrichene Fahrtdauer darf nicht negativ sein. Das deutet auf ungültige Sensor- oder Fahrtenaufzeichnungen hin. Ziel mit einer Regel für Gültigkeit (Bereich) (z. B. duration_minutes ≥ 1.0), um positive verstrichene Fahrzeiten zu erzwingen.
    start_station_id Null % Etwa 5% Nullwerte: Der Prozentsatz der Nullwerte ist größer als 0 %. Das bedeutet, dass in einigen Datensätzen keine Kennzeichnungen für die Stationsrückgabe vorhanden sind, z. B. bei Fahrten mit Fahrrädern ohne feste Stationen oder mit Kiosken. Verwenden Sie ein Ziel mit einer Vollständigkeitsregel (nicht null), um Datensätze mit fehlenden Sender-IDs zu erfassen und zu kennzeichnen.
    subscriber_type Top-Werte Unerwartete Kategorien: In der Liste der häufigen Werte werden neben gültigen Mitgliedschaftsstufen auch nicht standardmäßige Kategorien wie INVALID_TIER aufgeführt. Das deutet auf nicht validierte Nutzereingaben oder Probleme beim Import hin. Richten Sie die Ausrichtung mit einer Gültigkeitsregel (Set) ein, um zu erzwingen, dass alle eingehenden Werte zu Ihrer Liste der zulässigen Mitgliedschaftstypen gehören.
    trip_id Eindeutige Anzahl und % Doppelte IDs erkannt: Die Eindeutigkeit liegt unter 100% (ca. 98%), was auf wiederholte Kennsatzdatensätze hinweist. Primärschlüssel und Fahrten-IDs sollten zu 100% eindeutig sein. Richten Sie eine Eindeutigkeitsregel ein, um doppelte Fahrtdatensätze zu kennzeichnen und zu verhindern.

Anhand dieser Profilergebnisse können Sie eine evidenzbasierte Baseline erstellen, um gezielte Datenqualitätsregeln zu erstellen.

Datenqualitätsscan erstellen und ausführen

Nachdem Sie sich angesehen haben, wie die Daten aussehen, können Sie automatisierte Regeln für die Datenqualität einrichten, um Anomalien zu erkennen. In diesem Schritt konfigurieren Sie vier gängige Regeltypen basierend auf den Ergebnissen Ihres Profils.

Console

  1. Rufen Sie in der Google Cloud Console die Seite Datenprofilerstellung und ‑qualität auf.

    Zu „Datenprofilerstellung und ‑qualität“

  2. Klicken Sie auf Datenqualitätsscan erstellen.

  3. Geben Sie unter Allgemein im Feld Anzeigename bikeshare-trips-quality ein.

  4. Klicken Sie unter Zu scannende Tabelle im Feld Tabelle auf Durchsuchen, wählen Sie die Tabelle quickstart_data_profile.bikeshare_trips aus und klicken Sie dann auf Auswählen.

  5. Wählen Sie unter Umfang die Option Gesamte Daten aus.

  6. Wählen Sie für Zeitplan die Option Auf Abruf aus.

  7. Lassen Sie alle anderen Einstellungen unverändert und klicken Sie auf Weiter.

  8. Klicken Sie im Bereich Regeln zur Datenqualität auf Regeln hinzufügen und wählen Sie Integrierte Regeltypen aus.

  9. Wählen Sie im Bereich Regeln hinzufügen die Spalten und Regeltypen aus:

    • Klicken Sie im Feld Spalten auswählen auf Durchsuchen und wählen Sie duration_minutes, start_station_id, subscriber_type und trip_id aus.
    • Klicken Sie auf Auswählen.
    • Wählen Sie in der Liste Regeltypen auswählen die Optionen Bereichsprüfung, NULL-Prüfung, Prüfung des Wertesatzes und Eindeutigkeitsprüfung aus und klicken Sie dann auf OK.
    • Klicken Sie in der Liste der generierten Regeln die Kästchen für die folgenden Regeln an:

      • duration_minutes: Bereichsprüfung
      • start_station_id: NULL-Prüfung
      • subscriber_type: Prüfung des Wertesatzes
      • trip_id: Uniqueness check
    • Klicken Sie auf Auswählen.

  10. Konfigurieren Sie in der Tabelle Regeln für Datenqualität Parameter für die Regeln, für die Werte erforderlich sind:

    • Klicken Sie für duration_minutes (Bereichsprüfung) auf Bearbeiten, geben Sie 1.0 in das Feld Mindestwert ein und klicken Sie auf Speichern.
    • Klicken Sie für subscriber_type (Wertesatzprüfung) auf Bearbeiten, dann auf Wert hinzufügen, um die zulässigen Werte (Local Rider, Walk Up, Student Membership und Weekender) hinzuzufügen, und klicken Sie auf Speichern.
  11. Klicken Sie auf Weiter und dann auf Scan ausführen.

gcloud

  1. Erstellen Sie in Cloud Shell eine Datei mit dem Namen dq_bikeshare.yaml mit Regelspezifikationen, die auf die Anomalien in Ihrem Profil ausgerichtet sind:

    cat << 'EOF' > dq_bikeshare.yaml
    rules:
      - column: trip_id
        dimension: UNIQUENESS
        uniquenessExpectation: {}
      - column: start_station_id
        dimension: COMPLETENESS
        nonNullExpectation: {}
      - column: duration_minutes
        dimension: VALIDITY
        rangeExpectation:
          minValue: "1.0"
      - column: subscriber_type
        dimension: VALIDITY
        setExpectation:
          values:
            - "Local Rider"
            - "Walk Up"
            - "Student Membership"
            - "Weekender"
    EOF
    
  2. Datenqualitätsscan erstellen:

    gcloud dataplex datascans create data-quality bikeshare-trips-quality \
     --location=us-central1 \
     --data-source-resource="//bigquery.googleapis.com/projects/PROJECT_ID/datasets/quickstart_data_profile/tables/bikeshare_trips" \
     --data-quality-spec-file="dq_bikeshare.yaml" \
     --description="Data quality scan for sample bikeshare dataset"
    

    Ersetzen Sie PROJECT_ID durch IhreGoogle Cloud Projekt-ID.

  3. Führen Sie den Datenqualitätsscan aus:

    gcloud dataplex datascans run bikeshare-trips-quality \
     --location=us-central1
    

Evaluierungen von Datenqualitätsregeln prüfen

Sehen Sie sich die Ergebnisse zur Datenqualität an, um zu sehen, wie Ihre Regeln die Stichprobendaten bewertet und Anomalien erkannt haben.

  1. Rufen Sie in der Google Cloud Console die Seite Datenprofilerstellung und ‑qualität auf.

    Zu „Datenprofilerstellung und ‑qualität“

  2. Klicken Sie in der Tabelle Scans auf den Scan bikeshare-trips-quality.

  3. Klicken Sie im Abschnitt Übersicht auf Ergebnisse ansehen, um die Jobdetails zu öffnen.

  4. Sehen Sie sich im Bereich Jobdetails die Auswertungsergebnisse an:

    • Datenqualitätsstatus: Wie erwartet haben alle drei ausgewerteten Dimensionen den Status Fehler.

      • Gültigkeit: Fehlgeschlagen. Die Spalte duration_minutes enthält negative Werte und subscriber_type enthält ungültige Mitgliedschaftswerte (INVALID_TIER).
      • Vollständigkeit: Fehlgeschlagen. Die Spalte start_station_id enthält Nullwerte.
      • Eindeutigkeit: Fehlgeschlagen. Die Spalte trip_id enthält doppelte Datensätze.
    • Regeln: In der Tabelle Regeln haben alle vier ausgewerteten Regeln den Status Fehlgeschlagen.

      • duration_minutes: Bereichsprüfung (Fehler)
      • start_station_id: NULL-Prüfung (Fehlgeschlagen)
      • subscriber_type: Prüfung des Wertesets (Fehler)
      • trip_id: Prüfung auf Eindeutigkeit (Fehlgeschlagen)

      Bei jeder fehlgeschlagenen Regel können Sie die SQL-Abfrage in der Spalte Abfrage zum Abrufen fehlgeschlagener Datensätze kopieren und in BigQuery ausführen, um die ungültigen Zeilen zu isolieren und zu prüfen.

Sie haben jetzt eine BigQuery-Tabelle profiliert, um Spaltenstatistiken zu ermitteln, und diese Informationen verwendet, um automatische Datenqualitätsregeln zu definieren und zu validieren.

Bereinigen

Mit den folgenden Schritten vermeiden Sie, dass Ihrem Google Cloud -Konto die auf dieser Seite verwendeten Ressourcen in Rechnung gestellt werden:

Console

  1. Rufen Sie in der Google Cloud Console die Seite Datenprofilerstellung und ‑qualität auf.

    Zu „Datenprofilerstellung und ‑qualität“

  2. Wählen Sie in der Tabelle Scans die Optionen bikeshare-trips-quality und bikeshare-trips-profile aus.

  3. Klicken Sie auf Löschen und bestätigen Sie den Vorgang.

  4. Rufen Sie die Seite BigQuery auf.

    BigQuery aufrufen

  5. Klicken Sie im Bereich Explorer auf Datasets.

  6. Wählen Sie das Dataset quickstart_data_profile aus und klicken Sie dann auf Löschen.

gcloud

Löschen Sie in Cloud Shell den Datenqualitätsscan, den Datenprofilscan und das Beispieldataset:

gcloud dataplex datascans delete bikeshare-trips-quality --location=us-central1 --quiet
gcloud dataplex datascans delete bikeshare-trips-profile --location=us-central1 --quiet
bq rm -r -f -d PROJECT_ID:quickstart_data_profile

Ersetzen Sie PROJECT_ID durch IhreGoogle Cloud Projekt-ID.

Nächste Schritte