In diesem Dokument werden Tools und Techniken beschrieben, mit denen Sie den Zustand und die Leistung von Managed Spark-Clustern und -Jobs überwachen können.
Open-Source-Weboberflächen
Viele Open-Source-Komponenten von Managed Service for Apache Spark-Clustern wie Apache Hadoop und Apache Spark bieten Weboberflächen. Diese Oberflächen können verwendet werden, um Clusterressourcen und die Jobleistung zu überwachen. Mit der YARN Resource Manager-UI können Sie beispielsweise die Ressourcenzuweisung für YARN-Anwendungen in einem Managed Service for Apache Spark-Cluster ansehen.
Persistent History Server
Open-Source-Weboberflächen, die in einem Cluster ausgeführt werden, sind verfügbar, solange der Cluster ausgeführt wird. Sie werden beendet, wenn Sie den Cluster löschen. Wenn Sie Cluster- und Jobdaten nach dem Löschen eines Clusters ansehen möchten, können Sie einen Persistent History Server (PHS) erstellen.
Beispiel: Sie stoßen auf einen Jobfehler oder eine Verlangsamung, die Sie analysieren möchten. Sie beenden oder löschen den Jobcluster und rufen dann Jobverlaufsdaten mit Ihrem PHS auf und analysieren sie.
Nachdem Sie einen PHS erstellt haben, aktivieren Sie ihn in einem Managed Service for Apache Spark-Cluster oder einer Managed Service for Apache Spark-Batcharbeitslast, wenn Sie den Cluster erstellen oder die Batcharbeitslast senden. Ein PHS kann auf Verlaufsdaten für Jobs zugreifen, die in mehreren Clustern ausgeführt werden. So können Sie Jobs in einem Projekt überwachen, anstatt separate UIs zu verwenden, die in verschiedenen Clustern ausgeführt werden.
Managed Service for Apache Spark-Logs
Managed Service for Apache Spark erfasst die Logs, die von Apache Hadoop, Spark, Hive, ZooKeeper und anderen Open-Source-Systemen generiert werden, die in Ihren Clustern ausgeführt werden, und sendet sie an Logging. Diese Logs werden nach der Quelle der Logs gruppiert. So können Sie die für Sie interessanten Logs auswählen und ansehen. YARN NodeManager- und Spark Executor-Logs, die in einem Cluster generiert werden, werden beispielsweise separat gekennzeichnet. Weitere Informationen zu den Log-Inhalten und -Optionen von Managed Service for Apache Spark finden Sie unter Managed Service for Apache Spark-Logs.
Cloud Logging
Logging ist ein vollständig verwaltetes System zur Logverwaltung in Echtzeit. Es bietet Speicher für Logs, die von Google Cloud Diensten und Tools erfasst werden, um Logs im großen Maßstab zu suchen, zu filtern und zu analysieren. Managed Service for Apache Spark-Cluster generieren mehrere Logs, darunter Logs des Managed Service for Apache Spark-Dienst- Agents , Cluster-Startlogs und Logs von OSS-Komponenten wie YARN NodeManager- Logs.
Logging ist standardmäßig für Managed Service for Apache Spark-Cluster und Managed Service for Apache Spark-Batcharbeitslasten aktiviert. Logs werden regelmäßig nach Logging exportiert, wo sie auch nach dem Löschen des Clusters oder dem Abschluss der Arbeitslast gespeichert bleiben.
Managed Service for Apache Spark-Messwerte
Managed Service for Apache Spark-Cluster- und Job
messwerte mit dem Präfix dataproc.googleapis.com/ bestehen aus Zeitreihendaten, die
Einblicke in die Leistung eines Clusters geben, z. B. die CPU-Auslastung oder den
Jobstatus. Zu den benutzerdefinierten Messwerten von Managed Service for Apache Spark custom
metrics mit dem Präfix custom.googleapis.com/ gehören Messwerte, die von Open-Source-Systemen
ausgegeben werden, die im Cluster ausgeführt werden, z. B. der YARN-Messwert running applications. Wenn Sie sich mit den Messwerten von Managed Service for Apache Spark vertraut machen, können Sie Ihre Cluster effizient konfigurieren. Durch das Einrichten von messwertbasierten Benachrichtigungen können Sie Probleme schnell erkennen und darauf reagieren.
Managed Service for Apache Spark-Cluster- und Jobmesswerte werden standardmäßig kostenlos erfasst. Die Erfassung benutzerdefinierter Messwerte wird Kunden in Rechnung gestellt. Sie können die Erfassung benutzerdefinierter Messwerte beim Erstellen eines Clusters aktivieren. Die Erfassung von Managed Service for Apache Spark Spark Messwerten ist standardmäßig für Spark-Batcharbeitslasten aktiviert.
Cloud Monitoring
Monitoring verwendet Clustermetadaten und -messwerte, einschließlich HDFS-, YARN-, Job- und Vorgangsmesswerte, um Einblicke in den Zustand, die Leistung und die Verfügbarkeit von Managed Service for Apache Spark-Clustern und -Jobs zu geben. Mit Monitoring können Sie Messwerte untersuchen, Diagramme hinzufügen, Dashboards erstellen und Benachrichtigungen einrichten.
Metrics Explorer
Mit dem Metrics Explorer
können Sie Managed Service for Apache Spark
Messwerte ansehen. Managed Service for Apache Spark
Cluster-, Job- und Managed Service for Apache Spark Batchmesswerte werden unter
den Cloud Managed Service for Apache Spark Cluster, Cloud
Managed Service for Apache Spark Job und Cloud Managed Service for Apache Spark
Batch Ressourcen aufgeführt. Benutzerdefinierte Messwerte von Managed Service for Apache Spark werden unter
der VM Instances Ressource in der Custom Kategorie aufgeführt.
Diagramme
Mit dem Metrics Explorer können Sie Diagramme erstellen, in denen Managed Service for Apache Spark-Messwerte visualisiert werden.
Beispiel: Sie erstellen ein Diagramm, um die Anzahl der aktiven YARN-Anwendungen zu sehen, die in Ihren Clustern ausgeführt werden, und fügen dann einen Filter hinzu, um visualisierte Messwerte nach Clustername oder Region auszuwählen.
Dashboards
Sie können Dashboards erstellen um Managed Service for Apache Spark-Cluster und -Jobs mit Messwerten aus mehreren Projekten und verschiedenen Google Cloud Produkten zu überwachen. Sie können Dashboards in der Google Cloud Konsole auf der Seite Dashboard-Übersicht erstellen, indem Sie ein Diagramm auf der Seite Metrics Explorer anklicken, erstellen und dann speichern.
Benachrichtigungen
Sie können Benachrichtigungen für Managed Service for Apache Spark-Messwerte erstellen, um rechtzeitig über Cluster oder Jobprobleme informiert zu werden.
Nächste Schritte
- Informationen zu KI-gestützten Untersuchungen mit Gemini Cloud Assist
- Fehlerbehebung bei Problemen beim Erstellen von Clustern issues.
- Clusterdiagnosedaten ansehen.