Gérer les configurations de pipeline

Cette page décrit les différentes façons de gérer les configurations des pipelines déployés.

Avant de commencer

Cette page nécessite des connaissances de base sur les profils de calcul et les performances des pipelines.

Configuration du profil de calcul

Vous pouvez modifier le profil de calcul ou personnaliser les paramètres du profil de calcul par défaut qui exécute le pipeline. Pour en savoir plus, consultez Gérer les profils de calcul et Propriétés du provisionneur Managed Service for Apache Spark.

Configuration du pipeline

Pour chaque pipeline, vous pouvez activer ou désactiver l'instrumentation, comme les métriques de timing. Par défaut, l'instrumentation est activée. Si l'instrumentation est activée, lorsque vous exécutez le pipeline, Cloud Data Fusion génère des métriques pour chaque nœud de pipeline. Les métriques suivantes s'affichent dans l'onglet Métriques de chaque nœud. Les métriques de source, de transformation et de récepteur varient légèrement.

  • Records out
  • Records in
  • Nombre total d'erreurs
  • Records out per second
  • Min process time (one record)
  • Max process time (one record)
  • Standard deviation
  • Average processing time

Nous vous recommandons d'activer systématiquement l'instrumentation, sauf si l'environnement manque de ressources.

Pour les pipelines de traitement en flux continu, vous pouvez également définir l'intervalle de traitement par lot (en secondes ou en minutes) pour les données de flux.

Configuration du moteur

Apache Spark est le moteur d'exécution par défaut. Vous pouvez transmettre des paramètres personnalisés pour Spark. Pour en savoir plus, consultez Traitement en parallèle.

Ressources

Vous pouvez spécifier la mémoire et le nombre de processeurs pour le pilote et l'exécuteur Spark. Le pilote orchestre le job Spark. L'exécuteur gère le traitement des données dans Spark. Pour en savoir plus, consultez Gestion des ressources.

Alerte de pipeline

Vous pouvez configurer le pipeline pour qu'il envoie des alertes et lance des tâches de post-traitement une fois l'exécution du pipeline terminée. Vous créez des alertes de pipeline lorsque vous concevez le pipeline. Une fois le pipeline déployé, vous pouvez afficher les alertes. Vous pouvez modifier le pipeline pour changer les paramètres d'alerte. Pour en savoir plus, consultez Créer des alertes.

Pushdown de transformation

Vous pouvez activer le pushdown de transformation si vous souhaitez qu'un pipeline exécute certaines transformations dans BigQuery. Pour en savoir plus, consultez la présentation du pushdown de transformation.

Étapes suivantes