Piattaforma ML Diagnostics
Google Cloud ML Diagnostics è una piattaforma gestita end-to-end per ottimizzare, monitorare e diagnosticare i workload AI e ML su Google Cloud. Utilizza ML Diagnostics per monitorare i workload, nonché per raccogliere e visualizzare tutte le metriche, le configurazioni e i profili dei workload all'interno di un'unica piattaforma. ML Diagnostics è applicabile sia ai workload di addestramento sia a quelli di inferenza ed è compatibile con tutti gli orchestratori su Cloud TPU, inclusi Google Kubernetes Engine (GKE) e gli orchestratori personalizzati. ML Diagnostics include le seguenti funzionalità:
- Monitoraggio dei workload: monitora e diagnostica automaticamente i workload AI/ML in esecuzione su TPU GKE. Per ogni job GKE, il monitoraggio dei workload di ML Diagnostics crea automaticamente un'esecuzione di machine learning, monitora il ciclo di lavoro della TPU nel workload, rileva gli eventi che influiscono sul workload e analizza i diversi livelli del workload, come l'infrastruttura, l'orchestratore e il framework, per determinare le potenziali cause dell'evento.
- Esecuzioni di machine learning: utilizza ML Diagnostics per creare e registrare le esecuzioni di machine learning tramite Google Cloud CLI o integra l'SDK ML Diagnostics con il tuo workload. Puoi creare e registrare le esecuzioni automaticamente con il monitoraggio dei workload, eseguire il deployment delle istanze XProf gestite con le esecuzioni di machine learning e raccogliere e gestire le metriche, le configurazioni e le sessioni di profili dei workload.
- Esperienza gcloud CLI: utilizza le API ML Diagnostics tramite gcloud CLI per registrare e gestire le esecuzioni, eseguire il deployment delle risorse XProf gestite, visualizzare le sessioni di profili nei bucket di archiviazione e attivare le acquisizioni di profili dalla CLI. Puoi anche elencare tutti gli eventi rilevati dal monitoraggio dei workload e ottenere i dettagli dell'analizzatore per questi eventi tramite la CLI o l'API.
- SDK Python: utilizza l'SDK ML Diagnostics open source integrato con i workload ML per un'esperienza completa di diagnostica dei workload ML. Monitora i workload e raccogli e gestisci le metriche dei workload, le configurazioni e i profili su Google Cloud.
- Profilazione gestita: ML Diagnostics esegue il deployment di un'istanza gestita di XProf con un backend scalabile negli account associati, consentendo il caricamento rapido di profili di grandi dimensioni. Supporta l'accesso simultaneo ai profili da parte di più utenti e contiene funzionalità integrate come la profilazione multi-host e la profilazione on demand.
- Metriche dei workload: monitora le metriche dei workload, tra cui la qualità del modello, le prestazioni del modello e le metriche di sistema. Con il monitoraggio dei workload, puoi ottenere le metriche di sistema associate al workload senza integrare l'SDK.
- Gestione della configurazione dei workload: monitora le configurazioni dei workload, incluse le configurazioni software, le configurazioni di sistema e le configurazioni definite dall'utente.
- Visualizzazioni in Cluster Director e GKE: visualizza metriche, configurazioni e profili in Cluster Director e Google Kubernetes Engine nella Google Cloud console.
- Condivisione tramite link: collabora utilizzando link condivisibili con informazioni su esecuzioni di machine learning, monitoraggio dei workload, metriche e profili.
Percorsi utente
Puoi utilizzare automaticamente la piattaforma ML Diagnostics con il monitoraggio dei workload per tutti i job GKE oppure integrare l'SDK con il tuo workload per un'esperienza completa di diagnostica dei workload ML. Puoi interagire con il sistema di diagnostica ML tramite la console o la CLI. Google Cloud Il monitoraggio dei workload è disponibile automaticamente per tutti i workload di cui è stato eseguito il deployment con GKE su TPU.
Con la CLI, puoi utilizzare gcloud CLI di ML Diagnostics per creare o modificare un'esecuzione di machine learning ed eseguire il deployment delle risorse XProf gestite. Con l'SDK ML Diagnostics, l'SDK deve essere integrato nel workload ML per raccogliere e gestire le metriche e le configurazioni dei workload ed eseguire il deployment delle risorse XProf gestite.
Per iniziare, utilizza una delle seguenti guide:
Profilazione gestita con XProf
Puoi ottenere un'esperienza di profilazione gestita con XProf quando utilizzi la CLI o l'SDK. XProf è uno strumento open source di profilazione e analisi delle prestazioni per i workload di machine learning e fa parte dell'ecosistema OpenXLA.
I vantaggi di un'esperienza di profilazione gestita rispetto a un'esperienza di profilazione con hosting autonomo includono:
- Nessuna configurazione richiesta di XProf o di altre dipendenze.
- Maggiore sicurezza e protezione dalle vulnerabilità.
- Link condivisibili per la collaborazione.
- Caricamento più rapido di profili di grandi dimensioni.
- Supporto per l'accesso simultaneo ai profili da parte di più utenti con scalabilità automatica delle risorse in base al carico di accesso ai link.
- Funzionalità integrate come la profilazione multi-host e la profilazione on demand.
- Caricamento di più sessioni di profili in più esecuzioni con la stessa istanza XProf gestita.
- Non sono previsti costi per le risorse XProf gestite di cui è stato eseguito il deployment dalla piattaforma ML Diagnostics, il che rende XProf gestito più conveniente rispetto all'hosting autonomo di XProf.
Prerequisiti
Prima di utilizzare ML Diagnostics, abilita l'API Cluster Director e aggiungi le autorizzazioni IAM richieste. Se utilizzi GKE, il monitoraggio dei workload è già abilitato. Tuttavia, l'SDK ML Diagnostics e la profilazione on demand richiedono artefatti GKE aggiuntivi e la configurazione del cluster GKE. Per ulteriori informazioni, consulta Configurare GKE.
Abilitare l'API Cluster Director
Non è necessario utilizzare Cluster Director per eseguire il deployment e gestire i cluster per utilizzare il prodotto ML Diagnostics. ML Diagnostics funziona con i cluster gestiti da GKE, Cluster Director o orchestratori personalizzati. ML Diagnostics fa parte della famiglia di API Cluster Director, ma non dipende dall'utilizzo del prodotto Cluster Director da parte degli utenti.
Per ulteriori informazioni sull'abilitazione dell'API Cluster Director, consulta Abilitare un'API nel tuo Google Cloud progetto.
Autorizzazioni IAM
Il Google Cloud service account utilizzato dal workload richiede i seguenti ruoli IAM assegnati al progetto:
roles/hypercomputecluster.editor: per l'accesso completo alla creazione e alla gestione delle risorseMLRune alla visualizzazione dell'interfaccia utente.roles/logging.logWriter: per scrivere log e metriche in Cloud Logging.roles/storage.objectUser: per salvare i profili nel bucket Cloud Storage specificato inmachinelearning_run.
Puoi anche creare ruoli personalizzati che assegnano agli utenti un sottoinsieme di API necessarie per ML Diagnostics. Poiché gli utenti non devono utilizzare Cluster Director per gestire i cluster, devi assegnare solo le seguenti autorizzazioni:
hypercomputecluster.locations.gethypercomputecluster.locations.listhypercomputecluster.machineLearningRuns.createhypercomputecluster.machineLearningRuns.deletehypercomputecluster.machineLearningRuns.gethypercomputecluster.machineLearningRuns.listhypercomputecluster.machineLearningRuns.updatehypercomputecluster.operations.cancelhypercomputecluster.operations.deletehypercomputecluster.operations.gethypercomputecluster.operations.listresourcemanager.projects.getResourcemanager.projects.list
Per i workload su Google Kubernetes Engine, utilizza Workload Identity
Federation per associare un
Kubernetes Service Account a un Google Cloud service account a cui sono stati
concessi i ruoli richiesti. I pod in esecuzione sulla rete host (hostNetwork: true) non utilizzano Workload Identity Federation for GKE. Per questi casi, consulta Alternative a Workload Identity Federation for GKE.
Prezzi
Ti vengono addebitati i costi per l'archiviazione delle metriche tramite Cloud Logging e per l'archiviazione dei profili tramite Cloud Storage. Non è necessario abilitare alcuna fatturazione aggiuntiva per questi servizi quando si utilizza la piattaforma ML Diagnostics. Non sono previsti costi per le risorse XProf gestite di cui è stato eseguito il deployment dalla piattaforma ML Diagnostics.