- Collocazione delle risorse dell'infrastruttura AI
- Posizionamento in base alla topologia del cluster
- Modalità operativa dei cluster
- Pianificazione e controlli della manutenzione dei cluster
- Strumenti di monitoraggio e diagnostica dei cluster
La maggior parte delle funzionalità di gestione dei cluster è supportata solo per la capacità vincolata alla prenotazione, ovvero l'infrastruttura che utilizza il modello di provisioning vincolato alla prenotazione, che supporta solo i tipi di macchine con GPU in cluster. Per la capacità che utilizza qualsiasi altro modello di provisioning, sono disponibili solo le seguenti funzionalità di gestione dei cluster:
- Collocazione delle risorse dell'infrastruttura AI
- Posizionamento in base alla topologia del cluster
- Gestisci gli eventi sull'host nelle istanze
Collocazione delle risorse dell'infrastruttura AI
Quando utilizzi le GPU in cluster, come A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPU), puoi richiedere macchine host di cui Compute Engine esegue il provisioning il più vicino possibile. Queste macchine offrono le seguenti funzionalità:
Compute Engine esegue il provisioning delle macchine come blocchi di risorse.
Una rete di interconnessione di machine learning (ML) dinamica interconnette le macchine.
Questa disposizione delle risorse riduce al minimo gli hop di rete e ottimizza la latenza di rete più bassa. Per eseguire il deployment di blocchi di macchine ottimizzate per l'acceleratore di cui Compute Engine esegue l'allocazione densa, puoi utilizzare le seguenti opzioni:
Le risorse devono essere allocate in modo denso tra loro quando esegui una o più delle seguenti operazioni:
Crea risorse che utilizzano la stessa prenotazione futura in AI Hypercomputer o prenotazione futura in modalità calendario.
Esegui il deployment di un gruppo di istanze gestite (MIG) che utilizza le richieste di ridimensionamento e crea le risorse nella stessa richiesta.
Specifica che le risorse utilizzano la stessa policy di posizionamento compatto o la stessa policy del workload che specifica un valore di distanza massima. In particolare, le risorse devono essere vicine solo quanto specificato dal valore di distanza massima della policy.
Le risorse vengono allocate in modo denso tra loro, in base alla disponibilità best effort, quando esegui una o più delle seguenti operazioni:
Crea risorse nella stessa richiesta per le VM con avvio flessibile.
Specifica che le risorse utilizzano la stessa policy di posizionamento compatto o la stessa policy del workload che non specifica una distanza massima.
Posizionamento in base alla topologia del cluster
Dopo aver creato le GPU in cluster, puoi ottenere informazioni sulla topologia a livello di nodo e cluster. Queste informazioni ti aiutano a:
Modificare la progettazione dell'applicazione o del workload per ridurre ulteriormente la latenza di rete.
Comprendere e risolvere i problemi di latenza e prestazioni di rete per le istanze che comunicano frequentemente tra loro. Questi problemi possono verificarsi se le istanze si trovano inaspettatamente molto distanti tra loro.
In particolare, le informazioni sulla topologia sono supportate come segue:
Le informazioni sulla topologia funzionano meglio con la capacità vincolata alla prenotazione, che è necessaria per visualizzare la topologia di una prenotazione.
Per le VM spot, le informazioni sulla topologia vengono visualizzate solo quando una macchina utilizza una policy di posizionamento compatto o una policy del workload.
Per ulteriori informazioni, consulta le seguenti risorse:
- Per le istanze e i cluster Slurm, vedi Visualizzare la topologia delle istanze di computing.
- Per i cluster GKE, vedi Visualizzare la topologia dei nodi GKE e Pianificare i workload GKE con la Topology Aware Scheduling (TAS).
Modalità operativa dei cluster
Quando prenoti la capacità vincolata alla prenotazione per creare istanze di computing o cluster, il tipo di macchina che prenoti determina la modalità operativa del cluster per le istanze. Questa modalità specifica il comportamento delle istanze dopo gli errori dell'host o i report dell'host difettoso. Le modalità operative disponibili per un'istanza sono modalità gestita, in cui Compute Engine sostituisce automaticamente le macchine difettose, ma trattiene una parte della capacità prenotata per fornire alle istanze le risorse necessarie per il riavvio. Oppure la modalità a capacità totale, in cui hai accesso alla capacità prenotata completa, ma sei responsabile della gestione degli errori e della manutenzione pianificata.
Per ulteriori informazioni, vedi Modalità operativa della prenotazione.
Pianificazione e controlli della manutenzione dei cluster
Puoi controllare la manutenzione delle GPU in cluster utilizzando la pianificazione in base alla topologia in un blocco di risorse. Questa funzionalità consente di sincronizzare gli upgrade in modo che i workload siano più resilienti agli eventi host e di ridurre al minimo le interruzioni. Questo approccio contribuisce a migliorare il goodput del workload.
Per facilitare il controllo completo degli eventi di manutenzione, puoi utilizzare le seguenti funzionalità:
Tipo di pianificazione della manutenzione
Quando prenoti la capacità vincolata alla prenotazione per creare istanze di computing o cluster di GPU in cluster, puoi definire in che modo Compute Engine gestisce l'infrastruttura su cui vengono eseguite le istanze. In base al tipo di macchina che vuoi utilizzare per le istanze, puoi scegliere tra la manutenzione sincronizzata tra le istanze (raggruppata) o pianificazioni di manutenzione diverse (indipendenti).
Per ulteriori informazioni, vedi Tipi di pianificazione della manutenzione.
Gestisci gli eventi sull'host
Dopo aver creato le GPU in cluster e avviato il workload, puoi configurare gli avvisi e ricevere notifiche quando la manutenzione delle istanze o dei blocchi riservati è pianificata, inizia o viene completata. Puoi anche visualizzare e, se necessario, avviare manualmente la manutenzione di un'istanza o di un blocco riservato prima dell'orario pianificato. Queste opzioni ti aiutano a controllare in modo proattivo e a ridurre al minimo i tempi di inattività dei workload.
Per ulteriori informazioni, consulta le seguenti risorse:
Strumenti di monitoraggio e diagnostica dei cluster
Per il monitoraggio e la risoluzione dei problemi, i tipi di macchine con GPU in cluster includono i seguenti servizi per la capacità vincolata alla prenotazione:
Previsione del peggioramento dell'integrità delle VM, che ti aiuta a identificare le VM che probabilmente peggioreranno nelle prossime cinque ore.
Report dell'host difettoso, che puoi utilizzare per segnalare problemi con le singole macchine host.
Supporto per le metriche di Cloud Monitoring, che ti aiutano a monitorare le prestazioni di reti e GPU.