Einführung in BigQuery-Pipelines
Mit BigQuery-Pipelines können Sie Ihre BigQuery-Datenprozesse automatisieren und optimieren. Mit Pipelines können Sie Code-Assets nacheinander planen und ausführen, um die Effizienz zu steigern und den manuellen Aufwand zu reduzieren.
Übersicht
Pipelines basieren auf Dataform. Dataform führt nicht nur Code-Assets aus, sondern aktualisiert auch automatisch Metadaten in Knowledge Catalog für Tabellen, die in einer Pipeline erstellt wurden.
Eine Pipeline besteht aus mindestens einem der folgenden Code-Assets:
- Notebooks
- SQL-Abfragen
- Datenvorbereitung
- SQLX-Aufgaben, einschließlich Tabellen, Ansichten, Quellen und Datenqualitätstests
Mit Pipelines können Sie die Ausführung von Code-Assets planen. Sie können beispielsweise eine SQL-Abfrage planen, die täglich ausgeführt wird, und eine Tabelle mit den neuesten Quelldaten aktualisieren, die dann für ein Dashboard verwendet werden können.
In einer Pipeline mit mehreren Code-Assets legen Sie die Ausführungsreihenfolge fest. Wenn Sie beispielsweise ein Modell für maschinelles Lernen trainieren möchten, können Sie einen Workflow erstellen, in dem Daten mit einer SQL-Abfrage vorbereitet und dann in einem nachfolgenden Notebook mit diesen Daten trainiert werden.
Wenn Sie einen Pipeline-Lauf auslösen, führt BigQuery die Aktionen in der Reihenfolge aus, die durch ihre Abhängigkeiten definiert ist. Für jede Aktion führt BigQuery die folgenden Schritte aus:
- Führt den kompilierten SQL-Code in BigQuery aus.
- Aktualisiert den Aktionsstatus im Ausführungsprotokoll.
- Nach erfolgreichem Abschluss einer Aktion initiiert Dataform automatisch eine Metadatensynchronisierung mit Knowledge Catalog. Bei diesem Prozess wird Knowledge Catalog mit den semantischen Metadaten aktualisiert, die in Ihrer SQLX-Konfiguration definiert sind. Die Synchronisierung erfolgt asynchron und nutzt einen Wiederholungsmechanismus. So wird sichergestellt, dass sich Metadatenaktualisierungen nicht auf die Latenz Ihrer Pipeline auswirken oder zu Workflowfehlern führen, wenn die Dataplex API vorübergehend nicht verfügbar ist.
Leistungsspektrum
In einer Pipeline haben Sie folgende Möglichkeiten:
- Neue SQL-Abfragen, Notebooks, Datenaufbereitungen oder SQLX-Aufgaben erstellen oder vorhandene importieren
- Sie können eine Pipeline planen, damit sie automatisch zu einer bestimmten Zeit und mit einer bestimmten Häufigkeit ausgeführt wird.
- Pipeline für bestimmte Nutzer oder Gruppen freigeben
- Link zu einer Pipeline freigeben
Beschränkungen
Für Pipelines gelten die folgenden Einschränkungen:
- Pipelines sind nur in der Google Cloud Console verfügbar.
- Sie können die Region für das Speichern einer Pipeline nicht mehr ändern, nachdem sie erstellt wurde.
- Sie können Nutzern oder Gruppen Zugriff auf eine ausgewählte Pipeline gewähren, aber nicht auf einzelne Aufgaben in der Pipeline.
- Wenn eine geplante Pipelineausführung nicht vor dem Start der nächsten geplanten Ausführung abgeschlossen wird, wird die nächste geplante Ausführung übersprungen und mit einem Fehler markiert.
Standardregion für Code-Assets festlegen
Für alle neuen Code-Assets in Ihrem Google Cloud -Projekt wird eine Standardregion verwendet. Nachdem das Asset erstellt wurde, können Sie seine Region nicht mehr ändern.
So legen Sie die Standardregion für neue Code-Assets fest:
Rufen Sie die Seite BigQuery auf.
Klicken Sie im linken Bereich auf Dateien, um den Dateibrowser zu öffnen:
Klicken Sie neben dem Projektnamen auf Aktionen für den Bereich „Dateien“ ansehen > Code-Region wechseln.
Wählen Sie die Code-Region aus, die Sie als Standard verwenden möchten.
Klicken Sie auf Speichern.
Eine Liste der unterstützten Regionen finden Sie unter BigQuery Studio-Standorte.
Alle Code-Assets werden in Ihrer Standardregion für Code-Assets gespeichert. Durch das Aktualisieren der Standardregion wird die Region für alle Code-Assets geändert, die danach erstellt werden.
Kontingente und Limits
Für BigQuery-Pipelines gelten die Kontingente und Limits für Dataform.
Preise
Für die Ausführung von BigQuery-Pipelineaufgaben fallen in BigQuery Kosten für Computing und Speicher an. Weitere Informationen finden Sie unter BigQuery-Preise.
Für Pipelines mit Notebooks fallen Colab Enterprise-Laufzeitgebühren an, die sich nach dem Standardmaschinentyp richten. Preisinformationen finden Sie unter Colab Enterprise-Preise.
Jede Ausführung einer BigQuery-Pipeline wird mit Cloud Logging protokolliert. Das Logging wird automatisch für BigQuery-Pipelineausführungen aktiviert. Dies kann zu Abrechnungskosten für Cloud Logging führen. Weitere Informationen finden Sie unter Cloud Logging – Preise.