Pipelines verwalten

In diesem Dokument wird beschrieben, wie Sie BigQuery-Pipelines verwalten, einschließlich der Anzeige, Planung, Bereitstellung und des Löschens von Pipelines.

In diesem Dokument wird auch beschrieben, wie Sie Pipeline-Metadaten in Knowledge Catalog ansehen und verwalten.

Pipelines basieren auf Dataform. Sie können Pipelines, die in Dateien und Ordnern (Nutzerordner und Teamordner) oder in BigQuery Studio-Git-Repositories (Git-Ordner) (Vorabversion) gespeichert sind, organisieren und verwalten.

Hinweis

  1. BigQuery-Pipeline erstellen
  2. Wenn Sie Pipeline-Metadaten in Knowledge Catalog verwalten möchten, muss die Dataplex API in Ihrem Google Cloud Projekt aktiviert sein.

Erforderliche Rollen

Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Verwalten von Pipelines benötigen:

  • So rufen Sie Pipelines auf und führen sie aus:
  • So führen Sie Pipelines mit Nutzeranmeldedaten für ein Google-Konto aus: BigQuery-Dateneditor (roles/bigquery.dataEditor) für das Projekt oder bestimmte BigQuery-Datasets
  • So löschen Sie Pipelines: Dataform Admin (roles/dataform.Admin) für die Pipeline
  • So verwalten Sie Pipelines in Nutzerordnern:
  • So verwalten Sie Pipelines in Teamordnern:
  • So verwalten Sie Pipelines in Git-Repositories: Developer Connect OAuth User (roles/developerconnect.oauthUser) im Projekt
  • So rufen Sie Metadaten im Knowledge Catalog auf und verwalten sie: Dataplex Catalog-Bearbeiter (roles/dataplex.catalogEditor) für das Projekt oder die @bigquery-Eintragsgruppe

Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.

Weitere Informationen zu Dataform IAM finden Sie unter Zugriff mit IAM steuern. Weitere Informationen zu Rollen für Ordner finden Sie unter Ordner erstellen und verwalten. Weitere Informationen zu Rollen für Git-Repositories finden Sie unter Code mit BigQuery Studio-Git-Repositories verwalten.

Wenn Sie ein benutzerdefiniertes Dienstkonto zum Ausführen von Pipelines verwenden, müssen Sie diesem Dienstkonto die folgenden Rollen zuweisen:

Pipelines ansehen

Sie können Pipelines, die in Ordnern oder Git-Ordnern gespeichert sind, im Bereich Dateien ansehen und prüfen. Im Bereich Explorer können Sie eigenständige Pipelines und Pipelines, die in Ordnern gespeichert sind, aufrufen. Pipelines, die in Git-Ordnern gespeichert sind, werden nicht im Bereich Explorer angezeigt.

Pipelines im Bereich „Dateien“ ansehen

Pipelines, die in Ordnern oder Git-Ordnern gespeichert sind, werden direkt im Bereich Dateien angezeigt.

So rufen Sie eine Pipeline auf, die in einem Ordner oder Git-Ordner gespeichert ist:

  1. Rufen Sie in der Google Cloud Console die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im linken Bereich auf  Dateien, um den Dateibrowser zu öffnen.

    Wenn der linke Bereich nicht angezeigt wird, klicken Sie auf  Linken Bereich maximieren, um ihn zu öffnen.

  3. Erweitern Sie den Ordner Nutzer, einen Teamordner oder einen Ordner für ein verbundenes Git-Repository.

    Pipelines werden mit dem Symbol Pipeline anstelle eines Standardsymbols für Ordner angezeigt.

  4. Klicken Sie auf einen Pipelineordner, um den Pipeline Viewer zu öffnen.

    Im Pipeline Viewer werden der kompilierte gerichtete azyklische Graph (Directed Acyclic Graph, DAG) Ihrer Pipeline-Aufgaben, der Ausführungsstatus und die Konfigurationstabs angezeigt.

  5. Maximieren Sie das Pipelineverzeichnis im Dateibrowser, um verschachtelte Verzeichnisse (z. B. definitions/) und einzelne Aufgabendateien aufzurufen.

Pipelines im Explorer-Bereich ansehen

So rufen Sie eine Liste der eigenständigen Pipelines und der in Ordnern gespeicherten Pipelines auf:

  1. Rufen Sie in der Google Cloud Console die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im linken Bereich auf  Explorer:

    Hervorgehobener Button für den Explorer-Bereich.

    Wenn der linke Bereich nicht angezeigt wird, klicken Sie auf  Linken Bereich maximieren, um ihn zu öffnen.

  3. Maximieren Sie im Bereich Explorer Ihr Projekt und klicken Sie auf Pipelines.

  4. Wählen Sie eine Pipeline aus, um sie im Pipeline Viewer zu öffnen.

Bisherige manuelle Ausführungen ansehen

So rufen Sie die letzten manuellen Ausführungen einer ausgewählten Pipeline auf:

  1. Rufen Sie in der Google Cloud Console die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im linken Bereich auf  Explorer:

    Hervorgehobener Button für den Explorer-Bereich.

  3. Maximieren Sie im Bereich Explorer Ihr Projekt, klicken Sie auf Pipelines und wählen Sie dann eine Pipeline aus.

  4. Klicken Sie auf Ausführungen.

  5. Optional: Klicken Sie auf Aktualisieren, um die Liste der letzten Ausführungen zu aktualisieren.

Benachrichtigungen für fehlgeschlagene Pipelineausführungen konfigurieren

Jede Pipeline hat eine entsprechende Dataform-Repository-ID. Jede Ausführung einer BigQuery-Pipeline wird in Cloud Logging mit der entsprechenden Dataform-Repository-ID protokolliert. Mit Cloud Monitoring können Sie Trends in Cloud Logging-Logs für BigQuery-Pipelineausführungen beobachten und sich benachrichtigen lassen, wenn von Ihnen beschriebene Bedingungen auftreten.

Wenn Sie Benachrichtigungen erhalten möchten, wenn ein BigQuery-Pipeline-Lauf fehlschlägt, können Sie eine protokollbasierte Benachrichtigungsrichtlinie für die entsprechende Dataform-Repository-ID erstellen. Eine Anleitung finden Sie unter Benachrichtigungen für fehlgeschlagene Workflowaufrufe konfigurieren.

So finden Sie die Dataform-Repository-ID Ihrer Pipeline:

  1. Rufen Sie in der Google Cloud Console die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im linken Bereich auf  Explorer:

    Hervorgehobener Button für den Explorer-Bereich.

  3. Maximieren Sie im Bereich Explorer Ihr Projekt, klicken Sie auf Pipelines und wählen Sie dann eine Pipeline aus.

  4. Klicken Sie auf Einstellungen.

    Die Dataform-Repository-ID Ihrer Pipeline wird unten auf dem Tab Einstellungen angezeigt.

Pipeline löschen

So löschen Sie eine Pipeline endgültig:

  1. Rufen Sie in der Google Cloud Console die Seite BigQuery auf. BigQuery aufrufen
  • So löschen Sie eine Pipeline, die in einem Ordner oder Git-Ordner gespeichert ist:

    1. Klicken Sie im linken Bereich auf  Dateien.

    2. Suchen Sie im Dateibaum nach dem Pipelineordner, den Sie löschen möchten.

    3. Klicken Sie neben dem Pipeline-Ordner auf  Aktionen ansehen und dann auf Löschen.

    4. Klicken Sie im Bestätigungsdialogfeld auf Löschen.

      Der Pipeline-Ordner und alle darin enthaltenen Aufgaben und Dateien werden aus Ihrem Arbeitsbereich gelöscht.

  • So löschen Sie eine Pipeline, die im Bereich Explorer aufgeführt ist:

    1. Klicken Sie im linken Bereich auf  Explorer:

      Hervorgehobener Button für den Explorer-Bereich.

    2. Maximieren Sie im Bereich Explorer Ihr Projekt und klicken Sie auf Pipelines.

    3. Suchen Sie die Pipeline, die Sie löschen möchten.

    4. Klicken Sie neben der Pipeline auf  Aktionen ansehen und dann auf Löschen.

    5. Klicken Sie auf Löschen.

Metadaten in Knowledge Catalog verwalten

Mit Knowledge Catalog können Sie Metadaten für Pipelines speichern und verwalten. Pipelines sind standardmäßig in Knowledge Catalog verfügbar, ohne dass eine zusätzliche Konfiguration erforderlich ist.

Mit Knowledge Catalog können Sie Pipelines an allen Pipeline-Standorten verwalten. Die Verwaltung von Pipelines in Knowledge Catalog unterliegt den Knowledge Catalog-Kontingenten und ‑Limits und den Knowledge Catalog-Preisen.

Knowledge Catalog ruft automatisch die folgenden Metadaten aus Pipelines ab:

  • Name des Daten-Assets
  • Übergeordnetes Data Asset
  • Speicherort des Daten-Assets
  • Datentyp-Asset
  • Entsprechendes Google Cloud Projekt

In Knowledge Catalog werden Pipelines als Einträge mit den folgenden Eintragswerten protokolliert:

Systemeintragsgruppe
Die Systemeintragsgruppe für Pipelines ist @dataform. Wenn Sie Details zu Pipelineeinträgen im Knowledge Catalog aufrufen möchten, müssen Sie die System-Eintragsgruppe dataform aufrufen. Eine Anleitung dazu, wie Sie eine Liste aller Einträge in einer Eintragsgruppe aufrufen, finden Sie in der Knowledge Catalog-Dokumentation unter Details einer Eintragsgruppe ansehen.
Systemeintragstyp
Der Systemeintragstyp für Pipelines ist dataform-code-asset. Wenn Sie Details zu Pipelines aufrufen möchten, müssen Sie den Systemeingabetyp dataform-code-asset aufrufen, die Ergebnisse mit einem aspektbasierten Filter filtern und das Feld type im Aspekt dataform-code-asset auf WORKFLOW festlegen. Wählen Sie dann einen Eintrag der ausgewählten Pipeline aus. Eine Anleitung dazu, wie Sie Details zu einem ausgewählten Eintragstyp aufrufen, finden Sie in der Knowledge Catalog-Dokumentation unter Details zu einem Eintragstyp aufrufen. Eine Anleitung dazu, wie Sie die Details eines ausgewählten Eintrags aufrufen, finden Sie in der Knowledge Catalog-Dokumentation unter Details eines Eintrags ansehen.
Systemaspekttyp
Der Systemaspekttyp für Pipelines ist dataform-code-asset. Wenn Sie Pipelines in Knowledge Catalog zusätzlichen Kontext hinzufügen möchten, indem Sie Datenpipelineeinträge mit Aspekten annotieren, rufen Sie den Aspekttyp dataform-code-asset auf, filtern Sie die Ergebnisse mit einem aspektbasierten Filter und legen Sie das Feld type im Aspekt dataform-code-asset auf WORKFLOW fest. Eine Anleitung zum Annotieren von Einträgen mit Aspekten finden Sie in der Knowledge Catalog-Dokumentation unter Aspekte verwalten und Metadaten anreichern.
Typ
Der Typ für Daten-Canvas ist WORKFLOW. Mit diesem Typ können Sie Pipelines im System-Eintragstyp dataform-code-asset und im Aspekttyp dataform-code-asset mit der Abfrage aspect:dataplex-types.global.dataform-code-asset.type=WORKFLOW in einem aspektbasierten Filter filtern.

Eine Anleitung zum Suchen nach Assets in Knowledge Catalog finden Sie in der Knowledge Catalog-Dokumentation unter Nach Daten-Assets in Knowledge Catalog suchen.

Anreicherung von Metadaten und Integration von Scorecards zur Datenqualität

Dataform kann die folgenden Metadaten im Knowledge Catalog veröffentlichen:

  • Aspekttyp „Übersicht“
  • Allgemeiner Aspekttyp
  • Aspekttyp für Scorecard zur Datenqualität

Dataform-Assertions werden automatisch in die Knowledge Catalog-Datenqualitätsübersicht eingebunden. Während der Pipelineausführung werden die Ergebnisse aller Dataform-Assertions automatisch in Knowledge Catalog veröffentlicht. Anhand dieser Ergebnisse wird die Knowledge Catalog-Scorecard zur Datenqualität mit dem Status „Bestanden“ oder „Nicht bestanden“ gefüllt.

Eine Anleitung zum Prüfen des Status eines Metadaten-Updates finden Sie unter Letzte manuelle Ausführungen ansehen.

Nachdem die Metadaten synchronisiert wurden, können Sie im Knowledge Catalog nach dem Eintrag suchen und ihn aufrufen. Weitere Informationen finden Sie unter Nach Ressourcen suchen.

Nächste Schritte