Managed Airflow (3e génération) | Managed Airflow (2e génération) | Managed Airflow (1re génération héritée)
Cette page décrit la relation entre Orchestration Pipelines et Managed Airflow.
À propos d'Orchestration Pipelines
Orchestration Pipelines est un framework d'orchestration et de déploiement automatisé unifié et déclaratif, optimisé pour gérer de manière transparente les pipelines de données et d'IA sur Google Cloud.
Avec Orchestration Pipelines, vous pouvez définir vos pipelines et leurs configurations de déploiement à l'aide d'un langage spécifique à un domaine (DSL) déclaratif basé sur YAML. Ce framework fait abstraction de l'infrastructure sous-jacente, ce qui vous permet de vous concentrer sur la logique de vos workflows de données et d'IA, tandis qu'Orchestration Pipelines gère le déploiement, la gestion des versions et l'orchestration.
À propos des environnements Managed Airflow dans Orchestration Pipelines
Managed Airflow est le moteur d'orchestration qui exécute vos pipelines une fois qu'ils sont déployés. Vous attribuez un environnement Managed Airflow dans le cadre d'une définition de pipeline. Cet environnement est appelé environnement d'exécution dans Orchestration Pipelines.
Avantages d'Orchestration Pipelines :
Vous pouvez permettre aux équipes de votre organisation qui ne sont pas des experts Airflow de créer et d'exécuter leurs workflows sans écrire de DAG ni configurer Airflow. Par exemple, vous pouvez exécuter un notebook dans un cluster éphémère Managed Service pour Apache Spark et spécifier tous les paramètres de planification, de ressources et de configuration pour son exécution en YAML sans écrire de code DAG.
Toutes les configurations et tous les déploiements dans Orchestration Pipelines sont basés sur des commandes YAML et gcloud CLI. Tous les DAG Airflow sont générés automatiquement et il n'est pas nécessaire d'interagir avec Airflow, les environnements Managed Airflow ni les buckets d'environnement. Vous pouvez développer et déployer vos workflows dans un dépôt Git standard où se trouvent les fichiers d'éléments.
Vos définitions YAML fonctionnent sur toutes les versions d'Airflow. Vous n'avez pas besoin d'ajuster votre code pour les modifications entre les versions d'Airflow ni pour les différences dans les packages installés. Par exemple, il n'est pas nécessaire de migrer vos pipelines si vous passez d'Airflow 2 à Airflow 3.
Orchestration Pipelines est intégré à l'extension Google Cloud Data Agent Kit, ce qui vous permet d' utiliser la création et le dépannage basés sur des agents. Vous pouvez utiliser l'agent pour écrire vos pipelines, faciliter le déploiement et observer l'état de vos pipelines via la même extension.
Fonctionnement d'Orchestration Pipelines
Orchestration Pipelines est compatible avec diverses actions et Google Cloud services, tels que :
- Exécution de scripts PySpark dans Managed Service pour Apache Spark.
- Exécution de fichiers de notebook dans Managed Service pour Apache Spark.
- Exécution de requêtes SQL dans BigQuery ou Managed Service pour Apache Spark.
- Exécution de pipelines de traitement des données dans le framework Dataform ou dbt.
- Exécution de scripts Python.
Voici un workflow standard pour Orchestration Pipelines :
- Vous définissez votre pipeline comme une séquence d'actions qui doivent être exécutées à l'aide de l'un des Google Cloud services.
- Vous définissez les configurations de ressources pour les actions de votre pipeline. Par exemple, vous pouvez spécifier qu'une action particulière doit être exécutée sur un cluster éphémère Managed Service pour Apache Spark avec une configuration spécifique.
- (Facultatif) Vous définissez les ressources qui doivent être provisionnées automatiquement si elles n'existent pas déjà via le mécanisme de ressources provisionnées. Par exemple, vous pouvez spécifier qu'un cluster Managed Service pour Apache Spark statique dans une configuration spécifique doit être créé.
- Vous ajoutez votre fichier de définition de pipeline avec les actions que vous souhaitez exécuter dans un dépôt Git.
- Vous ajoutez des éléments pour des actions de pipeline individuelles (telles que des fichiers de script ou de notebook) à un dépôt Git.
Vous déployez vos pipelines dans votre environnement Managed Airflow avec une commande gcloud CLI. Orchestration Pipelines crée automatiquement quelques fichiers DAG qui exécutent votre pipeline.
Contrairement aux DAG Airflow autonomes, ces DAG sont générés automatiquement et vous n'avez pas besoin de les gérer de quelque manière que ce soit. Vous pouvez vérifier l'état de l'exécution de votre pipeline et gérer les pipelines avec des commandes gcloud CLI.
Votre environnement exécute le pipeline selon un calendrier.
Étape suivante
- Créer des pipelines d'ingénierie des données avec l'extension Google Cloud Data Agent Kit pour VS Code
- Déployer des pipelines d'orchestration
- Provisionner des ressources dans Orchestration Pipelines