ML Diagnostics-Plattform

Google Cloud ML Diagnostics ist eine End-to-End-Plattform zum Optimieren, Überwachen und Diagnostizieren von KI- und ML-Arbeitslasten in Google Cloud. Mit ML Diagnostics können Sie Arbeitslasten überwachen sowie alle Arbeitslastmesswerte, ‑konfigurationen und ‑profile zentral erfassen und visualisieren. ML Diagnostics kann sowohl für Trainings- als auch für Inferenzarbeitslasten verwendet werden und ist mit allen Orchestratoren auf Cloud TPU kompatibel, einschließlich Google Kubernetes Engine (GKE) und benutzerdefinierter Orchestratoren. ML Diagnostics umfasst die folgenden Funktionen:

  • Arbeitslastüberwachung: KI-/ML-Arbeitslasten, die auf GKE-TPUs ausgeführt werden, automatisch überwachen und diagnostizieren. Für jeden GKE-Job erstellt die ML Diagnostics-Arbeitslastüberwachung automatisch eine Machine-Learning-Ausführung, überwacht den TPU-Duty-Cycle für die Arbeitslast, erkennt Ereignisse, die sich auf die Arbeitslast auswirken, und analysiert verschiedene Ebenen der Arbeitslast, z. B. Infrastruktur, Orchestrator und Framework, um die potenziellen Ursachen des Ereignisses zu ermitteln.
  • Machine-Learning-Ausführungen:Mit ML Diagnostics können Sie Ausführungen des maschinellen Lernens über die Google Cloud CLI erstellen und registrieren oder das ML Diagnostics SDK in Ihre Arbeitslast einbinden. Sie können Ausführungen automatisch mit der Arbeitslastüberwachung erstellen und registrieren, verwaltete XProf-Instanzen mit Ihren Machine-Learning -Ausführungen bereitstellen sowie Arbeitslastmesswerte, ‑konfigurationen und ‑profil sitzungen erfassen und verwalten.
  • gcloud CLI:Verwenden Sie die ML Diagnostics APIs über die gcloud CLI, um Ausführungen zu registrieren und zu verwalten, verwaltete XProf-Ressourcen bereitzustellen, Profilsitzungen in Storage-Buckets zu visualisieren und Profilerfassungen über die CLI auszulösen. Sie können auch alle von der Arbeitslastüberwachung erkannten Ereignisse auflisten und über die CLI oder API Analysedetails für diese Ereignisse abrufen.
  • Python SDK: Verwenden Sie das Open-Source-ML Diagnostics SDK das in ML-Arbeitslasten eingebunden ist, um ML-Arbeitslasten umfassend zu diagnostizieren. Sie können Arbeitslasten überwachen sowie Arbeitslastmesswerte, ‑konfigurationen und ‑profile in Google Clouderfassen und verwalten.
  • Verwaltete Profilerstellung: ML Diagnostics stellt eine verwaltete Instanz von XProf mit einem skalierbaren Backend in verknüpften Konten bereit, sodass große Profile schnell geladen werden können. Es unterstützt den gleichzeitigen Zugriff mehrerer Nutzer auf Profile und enthält integrierte Funktionen wie die Profilerstellung für mehrere Hosts und die On-Demand-Profilerstellung.
  • Arbeitslastmesswerte: Arbeitslastmesswerte wie Modellqualität, Modell leistung und Systemmesswerte verfolgen. Mit der Arbeitslastüberwachung können Sie Systemmesswerte für die Arbeitslast abrufen, ohne das SDK einbinden zu müssen.
  • Verwaltung der Arbeitslastkonfiguration: Arbeitslastkonfigurationen wie Softwarekonfigurationen, Systemkonfigurationen und benutzerdefinierte Konfigurationen verfolgen.
  • Visualisierungen in Cluster Director und GKE: Messwerte, Konfigurationen und Profile in Cluster Director und Google Kubernetes Engine in der Google Cloud Console visualisieren.
  • Linkfreigabe: Mit freigegebenen Links mit Informationen zu Machine-Learning-Ausführungen, Arbeitslastüberwachung, Messwerten und Profilen zusammenarbeiten.

Nutzerpfade

Sie können die ML Diagnostics-Plattform automatisch mit dem Workload-Monitoring für alle GKE-Jobs verwenden oder das SDK in Ihre Arbeitslast einbinden, um ML-Workloads umfassend zu diagnostizieren. Sie können über die Google Cloud Console oder die CLI mit dem ML Diagnostics-System interagieren. Das Workload-Monitoring ist automatisch für alle Workloads verfügbar, die mit GKE auf TPUs bereitgestellt werden.

Mit der CLI können Sie die ML Diagnostics gcloud CLI verwenden, um eine Machine-Learning-Ausführung zu erstellen oder zu ändern und die verwalteten XProf-Ressourcen bereitzustellen. Mit dem ML Diagnostics SDK muss das SDK in Ihre ML-Arbeitslast eingebunden werden, um Arbeitslastmesswerte und ‑konfigurationen zu erfassen und zu verwalten sowie verwaltete XProf-Ressourcen bereitzustellen.

Verwenden Sie eine der folgenden Anleitungen, um zu beginnen:

Verwaltete Profilerstellung mit XProf

Sie können die verwaltete Profilerstellung mit XProf verwenden, wenn Sie entweder die CLI oder das SDK verwenden. XProf ist ein Open-Source-Tool zur Profilerstellung und Leistungsanalyse für Machine Learning Arbeitslasten und Teil des OpenXLA-Ökosystems.

Die Vorteile der verwalteten Profilerstellung im Vergleich zur selbst gehosteten Profilerstellung sind:

  • Keine Einrichtung von XProf oder anderen Abhängigkeiten erforderlich.
  • Bessere Sicherheit und Schutz vor Sicherheitslücken.
  • Freigegebene Links für die Zusammenarbeit.
  • Schnelleres Laden großer Profile.
  • Unterstützung für mehrere Nutzer, die gleichzeitig auf Profile zugreifen, mit automatischer Skalierung der Ressourcen basierend auf der Last des Linkzugriffs.
  • Integrierte Funktionen wie die Profilerstellung für mehrere Hosts und die On-Demand-Profilerstellung.
  • Mehrere Profilsitzungen für mehrere Ausführungen mit derselben verwalteten XProf-Instanz laden.
  • Für die von der ML Diagnostics-Plattform bereitgestellten verwalteten XProf-Ressourcen fallen keine Kosten an. Daher ist die verwaltete XProf-Profilerstellung kostengünstiger als das Selbsthosting von XProf.

Vorbereitung

Bevor Sie ML Diagnostics verwenden, aktivieren Sie die Cluster Director API und fügen Sie die erforderlichen IAM-Berechtigungen hinzu. Wenn Sie GKE verwenden, ist die Arbeitslastüberwachung bereits aktiviert. Für das ML Diagnostics SDK und die On-Demand-Profilerstellung sind jedoch zusätzliche GKE-Artefakte und die Konfiguration Ihres GKE-Cluster erforderlich. Weitere Informationen finden Sie unter Set up GKE.

Cluster Director API aktivieren

Sie müssen Cluster Director nicht verwenden, um Ihre Cluster bereitzustellen und zu verwalten, um das ML Diagnostics-Produkt zu verwenden. ML Diagnostics funktioniert mit Clustern, die von GKE, Cluster Director oder benutzerdefinierten Orchestratoren verwaltet werden. ML Diagnostics ist Teil der Cluster Director API-Familie, aber Nutzer müssen das Cluster Director-Produkt selbst nicht verwenden.

Weitere Informationen zum Aktivieren der Cluster Director API finden Sie unter API in Ihrem Google Cloud Projekt aktivieren.

IAM-Berechtigungen

Das Google Cloud von Ihrer Arbeitslast verwendete Dienstkonto muss die folgenden IAM-Rollen für das Projekt haben:

  • roles/hypercomputecluster.editor: Für vollständigen Zugriff zum Erstellen und Verwalten von MLRun-Ressourcen und zum Aufrufen der Benutzeroberfläche.
  • roles/logging.logWriter: Zum Schreiben von Logs und Messwerten in Cloud Logging.
  • roles/storage.objectUser: Zum Speichern von Profilen im Cloud Storage-Bucket, das in machinelearning_run angegeben ist.

Sie können auch benutzerdefinierte Rollen erstellen, mit denen Nutzern eine Teilmenge der für ML Diagnostics erforderlichen APIs zugewiesen wird. Da Nutzer Cluster Director nicht zum Verwalten von Clustern verwenden müssen, müssen Sie nur die folgenden Berechtigungen zuweisen:

  • hypercomputecluster.locations.get
  • hypercomputecluster.locations.list
  • hypercomputecluster.machineLearningRuns.create
  • hypercomputecluster.machineLearningRuns.delete
  • hypercomputecluster.machineLearningRuns.get
  • hypercomputecluster.machineLearningRuns.list
  • hypercomputecluster.machineLearningRuns.update
  • hypercomputecluster.operations.cancel
  • hypercomputecluster.operations.delete
  • hypercomputecluster.operations.get
  • hypercomputecluster.operations.list
  • resourcemanager.projects.get
  • Resourcemanager.projects.list

Verwenden Sie für Arbeitslasten in Google Kubernetes Engine die Identitätsföderation von Arbeitslasten, um ein Kubernetes-Dienstkonto mit einem Google Cloud Dienstkonto zu verknüpfen, dem die erforderlichen Rollen zugewiesen wurden. Pods, die im Hostnetzwerk (hostNetwork: true) ausgeführt werden, verwenden Workload Identity Federation for GKE nicht. In diesen Fällen finden Sie unter Alternativen zu Workload Identity Federation für GKE weitere Informationen.

Preise

Ihnen wird die Speicherung von Messwerten über Cloud Logging und die Speicherung von Profilen über Cloud Storage in Rechnung gestellt. Für diese Dienste muss bei Verwendung der ML Diagnostics-Plattform keine zusätzliche Abrechnung aktiviert werden. Für die von der ML Diagnostics-Plattform bereitgestellten verwalteten XProf-Ressourcen fallen keine Kosten an.