ML Diagnostics-Plattform

Google Cloud ML Diagnostics ist eine End-to-End-Plattform zum Optimieren, Überwachen und Diagnostizieren von KI- und ML-Arbeitslasten in Google Cloud. Mit ML-Diagnose können Sie Arbeitslasten überwachen sowie alle Arbeitslastmesswerte, ‑konfigurationen und ‑profile zentral erfassen und visualisieren. ML Diagnostics kann sowohl für Trainings- als auch für Inferenz-Arbeitslasten verwendet werden und ist mit allen Orchestratoren auf Cloud TPU kompatibel, einschließlich Google Kubernetes Engine (GKE) und benutzerdefinierten Orchestratoren. ML Diagnostics umfasst die folgenden Funktionen:

  • Arbeitslastüberwachung: KI-/ML-Arbeitslasten, die auf GKE-TPUs ausgeführt werden, automatisch überwachen und diagnostizieren. Für jeden GKE-Job erstellt ML Diagnostics Workload Monitoring automatisch einen Machine-Learning-Lauf, überwacht den TPU-Duty-Cycle für die Arbeitslast, erkennt Ereignisse, die sich auf die Arbeitslast auswirken, und analysiert verschiedene Ebenen der Arbeitslast, z. B. Infrastruktur, Orchestrator und Framework, um die potenziellen Ursachen des Ereignisses zu ermitteln.
  • Machine-Learning-Ausführungen:Mit ML Diagnostics können Sie Ihre Machine-Learning-Ausführungen über die Google Cloud CLI erstellen und registrieren oder das ML Diagnostics SDK in Ihre Arbeitslast einbinden. Sie können Läufe automatisch mit dem Workload-Monitoring erstellen und registrieren, verwaltete XProf-Instanzen mit Ihren Machine Learning-Läufen bereitstellen sowie Workload-Messwerte, Konfigurationen und Profilsitzungen erfassen und verwalten.
  • gcloud CLI:Mit den ML Diagnostics APIs über die gcloud CLI können Sie Läufe registrieren und verwalten, verwaltete XProf-Ressourcen bereitstellen, Profilsitzungen in Speicher-Buckets visualisieren und Profilerfassungen über die CLI auslösen. Sie können auch alle von der Arbeitslastüberwachung erkannten Ereignisse auflisten und über die Befehlszeile oder API Analysedetails für diese Ereignisse abrufen.
  • Python SDK: Verwenden Sie das Open-Source-ML Diagnostics SDK, das in ML-Arbeitslasten integriert ist, um eine vollständige Diagnose von ML-Arbeitslasten zu erhalten. Arbeitslasten überwachen sowie Arbeitslastmesswerte, ‑konfigurationen und ‑profile auf Google Clouderfassen und verwalten.
  • Verwaltetes Profiling: ML Diagnostics stellt eine verwaltete Instanz von XProf mit einem skalierbaren Backend in zugehörigen Konten bereit, sodass große Profile schnell geladen werden können. Es unterstützt mehrere Nutzer, die gleichzeitig auf Profile zugreifen, und enthält integrierte Funktionen wie die Profilerstellung für mehrere Hosts und die On-Demand-Profilerstellung.
  • Arbeitslastmesswerte: Arbeitslastmesswerte wie Modellqualität, Modellleistung und Systemmesswerte erfassen. Mit der Arbeitslastüberwachung können Sie Systemmesswerte für die Arbeitslast abrufen, ohne das SDK einbinden zu müssen.
  • Verwaltung der Arbeitslastkonfiguration: Arbeitslastkonfigurationen verfolgen, einschließlich Softwarekonfigurationen, Systemkonfigurationen und benutzerdefinierten Konfigurationen.
  • Visualisierungen in Cluster Director und GKE: Sie können Messwerte, Konfigurationen und Profile in Cluster Director und Google Kubernetes Engine in der Google Cloud -Konsole visualisieren.
  • Linkfreigabe: Sie können über freigabefähige Links zusammenarbeiten und Informationen zu Machine-Learning-Ausführungen, Workload-Monitoring, Messwerten und Profilen teilen.

Nutzerpfade

Sie können die ML Diagnostics-Plattform automatisch mit der Arbeitslastüberwachung für alle GKE-Jobs verwenden oder das SDK in Ihre Arbeitslast einbinden, um die vollständige ML-Arbeitslastdiagnose zu nutzen. Sie können über die Google Cloud -Konsole oder die CLI mit dem ML-Diagnosesystem interagieren. Das Workload-Monitoring ist automatisch für alle Workloads verfügbar, die mit GKE auf TPUs bereitgestellt werden.

Mit der CLI können Sie die ML Diagnostics-gcloud CLI verwenden, um eine Ausführung des maschinellen Lernens zu erstellen oder zu ändern und die verwalteten XProf-Ressourcen bereitzustellen. Mit dem ML Diagnostics SDK muss das SDK in Ihre ML-Arbeitslast integriert werden, um Arbeitslastmesswerte und ‑konfigurationen zu erfassen und zu verwalten und verwaltete XProf-Ressourcen bereitzustellen.

Verwenden Sie zum Einstieg eine der folgenden Anleitungen:

Verwaltetes Profiling mit XProf

Wenn Sie die CLI oder das SDK verwenden, können Sie mit XProf ein verwaltetes Profiling durchführen. XProf ist ein Open-Source-Tool zur Profilerstellung und Leistungsanalyse für Machine Learning-Arbeitslasten und Teil des OpenXLA-Ökosystems.

Die Vorteile eines verwalteten Profils im Vergleich zu einem selbst gehosteten Profil sind:

  • Es ist keine Einrichtung von XProf oder anderen Abhängigkeiten erforderlich.
  • Bessere Sicherheit und Schutz vor Sicherheitslücken.
  • Links zum Freigeben für die Zusammenarbeit.
  • Große Profile werden schneller geladen.
  • Unterstützung für mehrere Nutzer, die gleichzeitig auf Profile zugreifen, mit automatischer Skalierung von Ressourcen basierend auf der Linkzugriffslast.
  • Integrierte Funktionen wie die Profilerstellung für mehrere Hosts und die On-Demand-Profilerstellung.
  • Sie können mehrere Profilsitzungen über mehrere Läufe mit derselben verwalteten XProf-Instanz laden.
  • Für die von der ML Diagnostics-Plattform bereitgestellten verwalteten XProf-Ressourcen fallen keine Gebühren an. Daher ist die verwaltete XProf-Lösung kostengünstiger als das Selbsthosting von XProf.

Vorbereitung

Bevor Sie ML Diagnostics verwenden können, müssen Sie die Cluster Director API aktivieren und die erforderlichen IAM-Berechtigungen hinzufügen. Wenn Sie GKE verwenden, ist die Arbeitslastüberwachung bereits aktiviert. Für das ML Diagnostics SDK und das On-Demand-Profiling sind jedoch zusätzliche GKE-Artefakte und eine Konfiguration Ihres GKE-Cluster erforderlich. Weitere Informationen finden Sie unter GKE einrichten.

Cluster Director API aktivieren

Sie müssen Cluster Director nicht zum Bereitstellen und Verwalten Ihrer Cluster verwenden, um ML Diagnostics nutzen zu können. ML Diagnostics funktioniert mit Clustern, die von GKE, Cluster Director oder benutzerdefinierten Orchestratoren verwaltet werden. ML Diagnostics ist Teil der Cluster Director-API-Familie, hängt jedoch nicht davon ab, dass Nutzer das Cluster Director-Produkt selbst verwenden.

Weitere Informationen zum Aktivieren der Cluster Director API finden Sie unter API im Google Cloud -Projekt aktivieren.

IAM-Berechtigungen

Das von Ihrer Arbeitslast verwendete Google Cloud Dienstkonto muss die folgenden IAM-Rollen für das Projekt haben:

  • roles/hypercomputecluster.editor: Für vollständigen Zugriff zum Erstellen und Verwalten von MLRun-Ressourcen und zum Aufrufen der Benutzeroberfläche.
  • roles/logging.logWriter: Zum Schreiben von Logs und Messwerten in Cloud Logging.
  • roles/storage.objectUser: Profile im Cloud Storage-Bucket speichern, der in machinelearning_run angegeben ist.

Sie können auch benutzerdefinierte Rollen erstellen, mit denen Nutzern eine Teilmenge der für ML Diagnostics erforderlichen APIs zugewiesen wird. Da Nutzer Cluster nicht mit Cluster Director verwalten müssen, müssen Sie nur die folgenden Berechtigungen zuweisen:

  • hypercomputecluster.locations.get
  • hypercomputecluster.locations.list
  • hypercomputecluster.machineLearningRuns.create
  • hypercomputecluster.machineLearningRuns.delete
  • hypercomputecluster.machineLearningRuns.get
  • hypercomputecluster.machineLearningRuns.list
  • hypercomputecluster.machineLearningRuns.update
  • hypercomputecluster.operations.cancel
  • hypercomputecluster.operations.delete
  • hypercomputecluster.operations.get
  • hypercomputecluster.operations.list
  • resourcemanager.projects.get
  • Resourcemanager.projects.list

Verwenden Sie für Arbeitslasten in Google Kubernetes Engine die Workload Identity-Föderation, um ein Kubernetes-Dienstkonto mit einem Google Cloud -Dienstkonto zu verknüpfen, dem die erforderlichen Rollen zugewiesen wurden.

Preise

Die Speicherung von Messwerten über Cloud Logging und die Speicherung von Profilen über Cloud Storage werden Ihnen in Rechnung gestellt. Wenn Sie die ML Diagnostics-Plattform verwenden, müssen Sie für diese Dienste keine zusätzlichen Abrechnungen aktivieren. Für die von der ML Diagnostics-Plattform bereitgestellten verwalteten XProf-Ressourcen fallen keine Kosten an.