Ce document présente les outils et les techniques que vous pouvez utiliser pour surveiller l'état et les performances des clusters et des jobs Managed Spark.
Interfaces Web Open Source
De nombreux composants Open Source de cluster Managed Service pour Apache Spark, tels qu'Apache Hadoop et Apache Spark, fournissent des interfaces Web. Ces interfaces peuvent être utilisées pour surveiller les ressources du cluster et les performances des jobs. Par exemple, vous pouvez utiliser l'interface utilisateur de YARN Resource Manager pour afficher l'allocation des ressources d'application YARN sur un cluster Managed Service pour Apache Spark.
Serveur d'historique persistant
Les interfaces Web Open Source exécutées sur un cluster sont disponibles lorsque le cluster est en cours d'exécution, mais elles s'arrêtent lorsque vous supprimez le cluster. Pour afficher les données du cluster et des jobs après la suppression d'un cluster, vous pouvez créer un serveur d'historique persistant (PHS).
Exemple : Vous rencontrez une erreur de job ou un ralentissement que vous souhaitez analyser. Vous arrêtez ou supprimez le cluster de jobs, puis vous affichez et analysez les données d'historique des jobs à l'aide de votre PHS.
Une fois que vous avez créé un PHS, vous l'activez sur un cluster Managed Service pour Apache Spark ou une charge de travail par lot Managed Service pour Apache Spark lorsque vous créez le cluster ou envoyez la charge de travail par lot. Un PHS peut accéder aux données d'historique des jobs exécutés sur plusieurs clusters, ce qui vous permet de surveiller les jobs dans un projet au lieu de surveiller des interfaces utilisateur distinctes exécutées sur différents clusters.
Journaux Managed Service pour Apache Spark
Managed Service pour Apache Spark collecte les journaux générés par Apache Hadoop, Spark, Hive, ZooKeeper et d'autres systèmes Open Source exécutés sur vos clusters, et les envoie à Logging. Ces journaux sont regroupés en fonction de leur source, ce qui vous permet de sélectionner et d'afficher les journaux qui vous intéressent : par exemple, les journaux YARN NodeManager et Spark Executor générés sur un cluster sont étiquetés séparément. Pour en savoir plus sur le contenu et les options des journaux Managed Service pour Apache Spark , consultez Journaux Managed Service pour Apache Spark .
Cloud Logging
Logging est un système de gestion des journaux en temps réel entièrement géré. Il fournit un stockage pour les journaux ingérés à partir de Google Cloud services et d'outils afin de rechercher, filtrer et analyser les journaux à grande échelle. Les clusters Managed Service pour Apache Spark génèrent plusieurs journaux, y compris les journaux d'agent de service Managed Service pour Apache Spark , les journaux de démarrage de cluster et les journaux de composants OSS, tels que les journaux YARN NodeManager.
Logging est activé par défaut sur les clusters Managed Service pour Apache Spark et les charges de travail par lot Managed Service pour Apache Spark. Les journaux sont exportés périodiquement vers Logging, où ils sont conservés après la suppression du cluster ou la fin de la charge de travail.
Métriques Managed Service pour Apache Spark
Les métriques de cluster et de job Managed Service pour Apache Spark
,
préfixées par dataproc.googleapis.com/, sont constituées de données de séries temporelles qui
fournissent des insights sur les performances d'un cluster, telles que l'utilisation du processeur ou
l'état du job. Les métriques personnalisées
Managed Service pour Apache Spark, préfixées
par custom.googleapis.com/, incluent les métriques émises par les systèmes Open Source
exécutés sur le cluster, telles que la métrique YARN running applications. Obtenir des insights sur les métriques Managed Service pour Apache Spark peut vous aider à configurer vos clusters de manière efficace. La configuration d'alertes basées sur des métriques peut vous aider à identifier les problèmes et à y répondre rapidement.
Les métriques de cluster et de job Managed Service pour Apache Spark sont collectées par défaut sans frais. La collecte de personnalisées métriques est facturée aux clients. Vous pouvez activer la collecte de métriques personnalisées lorsque vous créez un cluster. La collecte de métriques Spark Managed Service pour Apache Spark est activée par défaut sur les charges de travail par lot Spark.
Cloud Monitoring
Monitoring utilise les métadonnées et les métriques du cluster, y compris les métriques HDFS, YARN, de job et d'opération, pour fournir une visibilité sur l' état, les performances et la disponibilité des clusters Managed Service pour Apache Spark et des jobs. Vous pouvez utiliser Monitoring pour explorer les métriques, ajouter des graphiques, créer des tableaux de bord et créer des alertes.
Explorateur de métriques
Vous pouvez utiliser l'explorateur de métriques
pour afficher les métriques Managed Service pour Apache Spark. Les métriques de cluster, de job et de traitement par lot Managed Service pour Apache Spark
sont listées sous
les Cloud Managed Service for Apache Spark Cluster, Cloud
Managed Service for Apache Spark Job et Cloud Managed Service for Apache Spark
Batch ressources. Les métriques personnalisées Managed Service pour Apache Spark sont listées sous la ressource VM Instances, catégorie Custom.
Graphiques
Vous pouvez utiliser l'explorateur de métriques pour créer des graphiques qui visualisent les métriques Managed Service pour Apache Spark.
Exemple : Vous créez un graphique pour afficher le nombre d'applications Yarn actives exécutées sur vos clusters, puis vous ajoutez un filtre pour sélectionner les métriques visualisées par nom de cluster ou par région.
Tableaux de bord
Vous pouvez créer des tableaux de bord pour surveiller les clusters et les jobs Managed Service pour Apache Spark à l'aide de métriques provenant de plusieurs projets et différents Google Cloud produits. Vous pouvez créer des tableaux de bord dans la Google Cloud console à partir de la page Aperçu des tableaux de bord en cliquant sur un graphique de la page Explorateur de métriques, puis en le créant et en l'enregistrant.
Alertes
Vous pouvez créer des alertes de métriques Managed Service pour Apache Spark afin de recevoir des notifications en temps opportun en cas de problème de cluster ou de job.
Étape suivante
- Découvrez les investigations basées sur l'IA avec Gemini Cloud Assist.
- Résolvez les problèmes de création de cluster issues.
- Affichez les données de diagnostic du cluster.