Istanze TPU nei MIG

I gruppi di istanze gestite (MIG) automatizzano la creazione, la configurazione e la gestione del ciclo di vita di una raccolta di VM. I gruppi di istanze gestite offrono vantaggi quali alta affidabilità tramite ripristino automatico e deployment regionali (multizona), scalabilità automatica per gestire carichi variabili e aggiornamenti in sequenza semplificati per le applicazioni. Per saperne di più, consulta Gruppi di istanze gestite.

Puoi utilizzare i MIG per creare e gestire VM TPU per le versioni TPU v5p, v6e e TPU7x. Puoi creare MIG con una singola VM TPU, VM TPU indipendenti (chiamate anche slice a host singolo) e MIG con VM TPU interconnesse (chiamate anche slice multihost).

Ogni slice in un MIG a host singolo ha al massimo una VM TPU. Le VM TPU all'interno del MIG non sono connesse con link Inter-Chip Interconnect (ICI).

Uno slice multi-host contiene più VM TPU interconnesse con link ICI.

MIG con una singola istanza VM TPU

Puoi creare e gestire una singola VM TPU utilizzando un MIG impostando le dimensioni di destinazione del MIG su 1. Questo approccio è utile se vuoi utilizzare funzionalità MIG come la riparazione automatica per una singola istanza. Per saperne di più, consulta Crea un MIG con slice TPU single-host.

MIG con slice TPU single-host

La creazione di un gruppo di istanze gestite (MIG) con più istanze TPU indipendenti è utile per i workload che richiedono diverse VM TPU individuali, ma non hanno bisogno di essere interconnesse con link ICI per i workload distribuiti. Ad esempio:

  • Servizio di inferenza: ogni VM nel MIG può gestire in modo indipendente le richieste di inferenza. Un gruppo di istanze gestite ti consente di scalare il numero di istanze di pubblicazione in base alla domanda e di gestirle come gruppo.
  • Attività indipendenti parallele: un MIG fornisce un modo per gestire molti job di addestramento piccoli e indipendenti o altri calcoli che possono essere eseguiti in parallelo su singole VM TPU.
  • Gestione: i MIG forniscono le seguenti funzionalità:
    • Deployment: definisci un template di istanza una sola volta e utilizza il MIG per creare più VM TPU identiche.
    • Scalabilità: regola il numero di VM TPU ridimensionando il MIG.
    • Aggiornamenti in sequenza: aggiorna il software o il tipo di macchina in tutte le VM in modo controllato.
  • Convenienza: per le attività che non richiedono tutta la potenza o l'interconnettività di una grande slice TPU, l'utilizzo di più slice TPU più piccole e indipendenti può essere più conveniente.

Per saperne di più, consulta Crea un MIG con slice TPU single-host.

MIG con uno slice multi-host

A differenza dei gruppi di sezioni TPU indipendenti, un MIG configurato per una sezione multi-host gestisce un insieme di VM TPU strettamente accoppiate tramite link ICI. In questo modo viene creata una singola slice TPU logica.

Vantaggi e prestazioni

I MIG per gli slice TPU multi-host forniscono la scalabilità e le prestazioni richieste per carichi di lavoro di machine learning intensivi.

  • Addestramento distribuito: l'addestramento dei modelli di machine learning spesso richiede più potenza TPU di quanta ne possa fornire una singola VM TPU. Le sezioni TPU più grandi distribuiscono il calcolo su molti chip TPU e VM, con i link ICI che consentono una rapida comunicazione tra loro. Questo è fondamentale per le prestazioni dell'addestramento.
  • Larghezza di banda di interconnessione elevata: la rete ICI offre una larghezza di banda maggiore e una latenza inferiore tra i chip TPU nella slice rispetto alla rete di data center (DCN) standard. Questo è essenziale per le operazioni sincrone comuni nell'addestramento di modelli di grandi dimensioni.

Operazioni atomiche del ciclo di vita

Per garantire l'integrità della topologia interconnessa, il MIG gestisce l'intera sezione come un'unica unità indivisibile durante il suo ciclo di vita.

  • Creazione: tutte le VM nella sezione vengono sottoposte al provisioning insieme. Se non è disponibile una capacità interconnessa e integra sufficiente per l'intera topologia richiesta, lo slice non viene creato.
  • Eliminazione: il MIG elimina l'intera sezione come unità.
  • Ridimensionamento: il ridimensionamento è limitato alla scalabilità da 0 alle dimensioni complete della sezione o dalle dimensioni complete della sezione a 0. Non puoi ridimensionare parzialmente una sezione multi-VM.

Requisiti di configurazione

La configurazione di un MIG multi-host richiede la definizione sia della topologia di interconnessione fisica sia delle proprietà delle singole istanze.

  • Policy del workload: devi specificare una policy del workload con il parametro accelerator-topology (ad esempio 4x4, 8x8 o 4x4x4). In questo modo, il MIG viene configurato per trattare le istanze come una singola sezione interconnessa. Per informazioni sulla topologia, consulta la sezione Topologia TPU.
  • Modello di istanza: definisce proprietà come il tipo di macchina, l'immagine disco e altre impostazioni per ogni VM all'interno della sezione.

Disponibilità delle slice e ripristino dagli errori

Quando utilizzi i MIG per creare uno slice TPU multi-host, il comportamento di recupero in caso di errore dipende dal modello di provisioning e dalla modalità di prenotazione che utilizzi:

  • Quando un MIG utilizza prenotazioni on demand, con avvio flessibile o (escluse le prenotazioni in modalità Tutta la capacità). In questo scenario, Compute Engine gestisce automaticamente il processo di recupero della sezione. Se si verifica un errore dell'host o dell'ICI, lo slice passa allo stato REACTIVATING. Tutte le VM nella slice passano allo stato REPAIRING, anche se non necessariamente tutte contemporaneamente. Compute Engine recupera automaticamente la slice riavviando le VM insieme sulla capacità integra.

  • Quando un MIG utilizza il modello di provisioning spot. In questo scenario, sei responsabile della gestione della procedura di recupero dello slice. Se si verifica la preemption delle VM spot, Compute Engine termina tutte le istanze nella slice. La sezione passa allo stato FAILED e le VM passano allo stato TERMINATED. Per eseguire il ripristino dallo stato non riuscito, devi ricreare manualmente lo slice.

  • Quando un MIG utilizza le prenotazioni in modalità Tutta la capacità. In questo scenario, sei responsabile della gestione della procedura di recupero dello slice. Se si verifica un errore, la sezione passa allo stato FAILED e devi ricrearla manualmente.

    Il comportamento in modalità Tutta la capacità dipende ulteriormente da quanto segue:

    • Errore dell'host o VM difettosa segnalata. La VM interessata passa allo stato REPAIRING. Una volta riparato l'hardware sottostante, la VM torna allo stato RUNNING.
    • Manutenzione di emergenza imminente. Quando avvii manualmente un evento di manutenzione, le VM passano dallo stato RUNNING allo stato REPAIRING. Al termine della manutenzione, la VM torna allo stato RUNNING.
    • Errore ICI. Le VM rimangono nello stato RUNNING, ma la transizione di stato della slice passa allo stato FAILED.

Per ricreare una sezione dopo il prerilascio delle VM spot o un errore in modalità Tutta la capacità, devi eseguire una delle seguenti operazioni:

  • Elimina e ricrea il MIG.
  • Ridimensiona il MIG a 0 e poi aumentalo fino alla dimensione richiesta.

Recupero da errori in seguito a un'interruzione dell'istanza

Se elimini o arresti un'istanza TPU oppure arresti un'istanza dal sistema operativo, lo slice passa allo stato FAILED. In questo scenario, lo slice rimane nello stato FAILED finché non lo ricrei. Per ricreare lo slice, devi eliminare e ricreare il MIG oppure ridimensionarlo a 0 e poi aumentarne le dimensioni.

Per saperne di più sugli stati delle sezioni, consulta Visualizzare lo stato di una sezione TPU.

Limitazioni

Le sezioni seguenti spiegano le limitazioni per la creazione di un MIG con VM TPU.

Limitazioni per i modelli di istanza

I modelli di istanza che specificano un tipo di macchina TPU presentano le seguenti limitazioni:

  • Quando utilizzi il modello di provisioning con prenotazione, devi impostare l'azione di terminazione dell'istanza su elimina.

  • Le TPU possono utilizzare solo prenotazioni con target specifico.

  • Non puoi specificare una policy di posizionamento.

  • Non devi disattivare il riavvio automatico nei seguenti casi:

    • Slice multihost che utilizzano modelli di provisioning standard, con avvio flessibile o con prenotazione (inclusa la modalità Tutta la capacità).

    • Single-host che utilizza il modello di provisioning con prenotazione in modalità Tutta la capacità.

  • Non devi abilitare il riavvio automatico quando utilizzi il modello di provisioning spot.

Limitazioni per i gruppi di istanze gestite

I MIG con TPU presentano le seguenti limitazioni:

  • Operazioni del ciclo di vita: non puoi arrestare, avviare, riprendere o sospendere le istanze TPU. Per modificare le configurazioni che richiedono un riavvio o per interrompere l'addebito dei costi, devi eliminare le istanze.

  • Distribuzione delle zone del MIG a livello di regione: devi impostare la forma di distribuzione target su ANY_SINGLE_ZONE.

  • Aggiornamenti della configurazione in un MIG:

    • Non puoi aggiornare un MIG che forma una sezione TPU multi-host a causa della topologia dell'acceleratore definita.
    • Puoi aggiornare un gruppo di istanze gestite che formano slice TPU a host singolo utilizzando i metodi automatici o selettivi. Tuttavia, gli aggiornamenti per lo slice TPU a un solo host non supportano l'azione di riavvio (RESTART). Se è necessario un riavvio e l'azione più invasiva consentita è la sostituzione (REPLACE), lo strumento di aggiornamento sostituirà l'istanza; in caso contrario, il tentativo di aggiornamento non andrà a buon fine e verrà visualizzato un errore.
  • Per un MIG che forma uno slice TPU multi-host, si applicano anche le seguenti limitazioni:

    • Policy di dimensione target: devi impostare la modalità della policy di dimensione target su BULK. Una volta impostata questa modalità, non potrai più modificarla.

    • Dimensione target: in modalità in blocco, puoi impostare la dimensione target su 0 o sul numero di istanze necessarie per formare la topologia dell'acceleratore.

    • Policy del workload: devi specificare una policy del workload in cui è definita la topologia dell'acceleratore. Una volta impostata la policy del workload, non puoi modificarla o rimuoverla dal MIG.

    • Riparazioni avviate dal MIG: devi disattivare le riparazioni avviate dal MIG impostando il campo defaultActionOnFailure su DO_NOTHING. In questa configurazione, il MIG non esegue alcuna azione su un'istanza non riuscita. Compute Engine recupera automaticamente l'istanza non riuscita riavviando tutte le istanze nella stessa sezione sulla capacità integra.

  • Funzionalità non supportate: i MIG con TPU non supportano le seguenti funzionalità:

Passaggi successivi