Managed Airflow (Gen 3) | Managed Airflow (Gen 2) | Managed Airflow (Legacy Gen 1)
Auf dieser Seite wird die Beziehung zwischen Orchestrierungspipelines und Managed Airflow beschrieben.
Orchestration Pipelines
Orchestration Pipelines ist ein einheitliches, deklaratives Framework für die Orchestrierung und automatisierte Bereitstellung, das für die nahtlose Verwaltung von Daten- und KI-Pipelines optimiert ist Google Cloud.
Mit Orchestrierungspipelines können Sie Ihre Pipelines und ihre Bereitstellungskonfigurationen mithilfe einer deklarativen YAML-basierten domänenspezifischen Sprache (Domain Specific Language, DSL) definieren. Dieses Framework abstrahiert die zugrunde liegende Infrastruktur, sodass Sie sich auf die Logik Ihrer Daten- und KI-Workflows konzentrieren können, während Orchestrierungspipelines die Bereitstellung, Versionierung und Orchestrierung übernimmt.
Managed Airflow-Umgebungen in Orchestration Pipelines
Managed Airflow ist die Orchestrierungs-Engine, die Ihre Pipelines nach der Bereitstellung ausführt. Sie weisen eine Managed Airflow-Umgebung als Teil einer Pipelinedefinition zu. Diese Umgebung wird in Orchestrierungspipelines als Runner-Umgebung bezeichnet.
Vorteile von Orchestrierungspipelines:
Sie können Teams in Ihren Organisationen, die keine Airflow-Experten sind, in die Lage versetzen, ihre Workflows zu erstellen und auszuführen, ohne DAGs zu schreiben oder Airflow zu konfigurieren. Sie können beispielsweise ein Notebook in einem kurzlebigen Managed Service for Apache Spark-Cluster ausführen und alle Parameter für Zeitplan, Ressourcen und Konfiguration für die Ausführung in YAML angeben, ohne DAG-Code zu schreiben.
Die gesamte Konfiguration und Bereitstellung in Orchestrierungspipelines basiert auf YAML- und gcloud CLI-Befehlen. Alle Airflow-DAGs werden automatisch generiert und die Interaktion mit Airflow, Managed Airflow-Umgebungen oder Umgebungs-Buckets ist nicht erforderlich. Sie können Ihre Workflows in einem regulären Git-Repository entwickeln und bereitstellen, in dem sich die Asset-Dateien befinden.
Ihre YAML-Definitionen funktionieren mit allen Airflow-Versionen. Sie müssen Ihren Code nicht an Änderungen zwischen Airflow-Versionen oder Unterschiede bei den installierten Paketen anpassen. Beispielsweise ist es nicht erforderlich, Ihre Pipelines zu migrieren, wenn Sie von Airflow 2 zu Airflow 3 wechseln.
Orchestrierungspipelines sind in das Google Cloud Data Agent Kit integriert, sodass Sie die agentengestützte Erstellung und Fehlerbehebung nutzen können. Sie können den Agenten verwenden, um Ihre Pipelines zu schreiben, die Bereitstellung zu vereinfachen und den Status Ihrer Pipelines mit Ihrer bevorzugten IDE oder CLI zu beobachten.
Funktionsweise von Orchestrierungspipelines
Orchestrierungspipelines unterstützen eine Vielzahl von Aktionen und Google Cloud Diensten, z. B.:
- PySpark-Skripts in Managed Service for Apache Spark ausführen
- Notebook-Dateien in Managed Service for Apache Spark ausführen
- SQL-Abfragen in BigQuery oder Managed Service for Apache Spark ausführen
- Datenverarbeitungspipelines im Dataform- oder dbt-Framework ausführen
- Python-Skripts ausführen
Ein typischer Workflow für Orchestrierungspipelines sieht so aus:
- Sie definieren Ihre Pipeline als eine Sequenz von Aktionen die mit einem der Google Cloud Dienste ausgeführt werden müssen.
- Sie definieren Ressourcenkonfigurationen für Ihre Pipelineaktionen. Sie können beispielsweise angeben, dass eine bestimmte Aktion in einem kurzlebigen Managed Service for Apache Spark-Cluster mit einer bestimmten Konfiguration ausgeführt werden muss.
- Optional: Sie definieren Ressourcen, die automatisch bereitgestellt werden müssen, wenn sie noch nicht vorhanden sind, und zwar über den Mechanismus für bereitgestellte Ressourcen. Sie können beispielsweise angeben, dass ein statischer Managed Service for Apache Spark-Cluster mit einer bestimmten Konfiguration erstellt werden muss.
- Sie fügen Ihrem Git-Repository die Pipelinedefinitionsdatei mit den auszuführenden Aktionen hinzu.
- Sie fügen einem Git-Repository Assets für einzelne Pipelineaktionen hinzu, z. B. Skript- oder Notebook-Dateien.
Sie stellen Ihre Pipelines mit einem gcloud CLI-Befehl in Ihrer Managed Airflow-Umgebung bereit. Orchestration Pipelines erstellt automatisch einige DAG-Dateien, die Ihre Pipeline ausführen.
Im Vergleich zu eigenständigen Airflow-DAGs werden diese DAGs automatisch generiert und müssen nicht verwaltet werden. Sie können den Status der Pipelineausführung prüfen und Pipelines mit gcloud CLI-Befehlen verwalten.
Ihre Umgebung führt die Pipeline nach einem Zeitplan aus.
Pipelinestatus beobachten
Sie können den Status aller Pipelines, die in Ihrer Umgebung ausgeführt werden, und den Pipelineausführungsverlauf in der Google Cloud Console und der Google Cloud CLI aufrufen. Weitere Informationen finden Sie unter Orchestrierungspipelines verwalten.
Nächste Schritte
- Daten-Engineering-Pipelines mit der Google Cloud Data Agent Kit-Erweiterung für VS Code erstellen
- Orchestrierungspipelines bereitstellen
- Ressourcen in Orchestrierungspipelines bereitstellen