Orchestration Pipelines ist ein einheitliches, deklaratives Framework für die Orchestrierung und automatisierte Bereitstellung, das für die nahtlose Verwaltung von Daten- und KI-Pipelines auf Google Cloudoptimiert ist.
Mit Orchestration Pipelines können Sie Ihre Pipelines und ihre Bereitstellungskonfigurationen mithilfe einer deklarativen YAML-basierten Domain Specific Language (DSL) definieren. Dieses Framework abstrahiert die zugrunde liegende Infrastruktur, sodass Sie sich auf die Logik Ihrer Daten- und KI-Workflows konzentrieren können, während Orchestration Pipelines die Bereitstellung, Versionsverwaltung und Orchestrierung übernimmt.
Vorgesehene Nutzungsszenarien
Orchestration Pipelines wurde für Data Engineers und Data Scientists entwickelt, die Folgendes benötigen:
- Robuste CI/CD für Datenpipelines einrichten:Pipelines automatisch validieren und bereitstellen, wenn Änderungen an einem Repository vorgenommen werden.
- Mehrere Bereitstellungsumgebungen verwalten:Separate Konfigurationen für Entwicklungs-, Staging- und Produktionsumgebungen mit jeweils eigenen Runner-Einstellungen und Ressourcen verwalten.
- Pipelines mit bevorzugten Tools erstellen:Beliebige IDEs (z. B. Colab, VS Code oder JupyterLab) und Sprachen verwenden, um Pipelines zu entwickeln, die auf verschiedenen Engines ausgeführt werden.
- Bereitstellungskonsistenz gewährleisten:Versionierte Pipeline-Bundles verwenden, um sicherzustellen, dass alle Assets und Konfigurationen für eine bestimmte Version zusammen bereitgestellt und ausgeführt werden.
Hauptfunktionen des Produkts
- Deklarative DSL:Eine YAML-basierte Sprache zum Definieren von Pipelines, Aktionen und Bereitstellungskonfigurationen.
- Bereitstellungsumgebungen:Unterstützung für mehrere Umgebungen, die jeweils mit einer eigenen Runner-Umgebung (z. B. Managed Service for Apache Airflow) und einem eigenen Artefaktspeicher konfiguriert sind.
- Pipeline-Bundles mit Versionsverwaltung und Reproduzierbarkeit:Versionierte Pakete mit Pipelinedefinitionen und zugehörigen Assets (z. B. Python-Skripts), die als eine Einheit bereitgestellt werden. Jede Bereitstellung wird verfolgt, sodass Sie bestimmte Ausführungen einfach zurücksetzen oder reproduzieren können.
- Variablensubstitution und Secret-Verwaltung:Flexibles System zum Parametrisieren von Pipelines mit benutzerdefinierten Variablen, Umgebungsvariablen und Secrets von CI/CD-Anbietern.
- Validierungstools:Integrierte Befehle zum Prüfen der Syntax und semantischen Korrektheit Ihrer Pipelines vor der Bereitstellung.
- Manuelle und geplante Trigger:Unterstützung für die automatische Planung und manuelle Ausführung von Pipelines.
Unterstützte Frameworks und Einbindungen
Orchestration Pipelines ist für die Einbindung in eine Vielzahl von Tools und Diensten konzipiert:
- Orchestrierungs-Engines:Managed Service for Apache Airflow (Gen 2 und Gen 3), einschließlich Unterstützung für Airflow 2 und Airflow 3.
- Compute- und Daten-Engines:BigQuery, Managed Service for Apache Spark, Managed Service for Apache Spark, Dataform, DBT.
- Entwicklungsumgebungen:VS Code und Antigravity über die Google Cloud Data Agent Kit-Erweiterung.
- Git-Anbieter:GitHub.