Istanze TPU nei MIG

I gruppi di istanze gestite (MIG) automatizzano la creazione, la configurazione e la gestione del ciclo di vita di una raccolta di VM. I MIG offrono vantaggi come l'alta affidabilità tramite il ripristino automatico e i deployment regionali (multizona), la scalabilità automatica per gestire carichi variabili e gli aggiornamenti in sequenza semplificati per le applicazioni. Per ulteriori informazioni, vedi Gruppi di istanze gestite.

Puoi utilizzare i MIG per creare e gestire VM TPU per le versioni TPU v5p, v6e e TPU7x. Puoi creare MIG con una singola VM TPU, VM TPU indipendenti (chiamate anche slice a host singolo) e MIG con VM TPU interconnesse (chiamate anche slice multi-host).

Ogni slice in un MIG a host singolo ha al massimo una VM TPU. Le VM TPU all'interno del MIG non sono connesse con link Inter-Chip Interconnect (ICI).

Una slice multi-host contiene più VM TPU interconnesse con link ICI.

MIG con slice TPU a host singolo

La creazione di un gruppo di istanze gestite (MIG) con più istanze TPU indipendenti è utile per i carichi di lavoro che richiedono diverse VM TPU individuali, ma non è necessario che siano interconnesse con link ICI per i carichi di lavoro distribuiti. Ad esempio:

  • Serving di inferenza: ogni VM nel MIG può gestire in modo indipendente le richieste di inferenza. Un MIG ti consente di scalare il numero di istanze di serving in base alla domanda e di gestirle come gruppo.
  • Attività indipendenti parallele: un MIG fornisce un modo per gestire molti job di addestramento piccoli e indipendenti o altri calcoli che possono essere eseguiti in parallelo su singole VM TPU.
  • Gestione: i MIG forniscono le seguenti funzionalità:
    • Deployment: definisci un template di istanza una sola volta e utilizza il MIG per creare più VM TPU identiche.
    • Scalabilità: regola il numero di VM TPU ridimensionando il MIG.
    • Aggiornamenti in sequenza: aggiorna il software o il tipo di macchina su tutte le VM in modo controllato.
  • Convenienza: per le attività che non richiedono la piena potenza o interconnettività di una slice TPU di grandi dimensioni, l'utilizzo di più slice TPU più piccole e indipendenti può essere più conveniente.

Per ulteriori informazioni, vedi Creare un MIG con slice TPU a host singolo.

MIG con una slice multi-host

A differenza dei gruppi di slice TPU indipendenti, un MIG configurato per una slice multi-host gestisce un insieme di VM TPU strettamente accoppiate tramite link ICI. In questo modo viene creata una singola slice TPU logica.

Vantaggi e prestazioni

I MIG per le slice TPU multi-host forniscono la scalabilità e le prestazioni richieste per i carichi di lavoro di machine learning intensivi.

  • Addestramento distribuito: l'addestramento dei modelli di machine learning spesso richiede più potenza TPU di quella che può fornire una singola VM TPU. Le slice TPU più grandi distribuiscono il calcolo su molti chip e VM TPU, con i link ICI che consentono una comunicazione rapida tra di loro. Questo è fondamentale per le prestazioni di addestramento.
  • Larghezza di banda di interconnessione elevata: la rete ICI fornisce una larghezza di banda maggiore e una latenza inferiore tra i chip TPU nella slice rispetto alla rete di data center (DCN) standard. Questo è essenziale per le operazioni sincrone comuni nell'addestramento di modelli di grandi dimensioni.

Operazioni del ciclo di vita atomiche

Per garantire l'integrità della topologia interconnessa, il MIG gestisce l'intera slice come un'unica unità indivisibile durante il suo ciclo di vita.

  • Creazione: tutte le VM nella slice vengono sottoposte a provisioning contemporaneamente. Se non è disponibile una capacità interconnessa e integra sufficiente per l'intera topologia richiesta, la slice non viene creata.
  • Eliminazione: il MIG elimina l'intera slice come unità.
  • Ridimensionamento: il ridimensionamento è limitato alla scalabilità da 0 alle dimensioni complete della slice, o dalle dimensioni complete della slice a 0. Non puoi ridimensionare parzialmente una slice multi-VM.

Requisiti di configurazione

La configurazione di un MIG multi-host richiede la definizione sia della topologia di interconnessione fisica sia delle singole proprietà dell'istanza.

  • Policy del workload: devi specificare una policy del workload con il parametro accelerator-topology (ad esempio, 4x4, 8x8 o 4x4x4). In questo modo il MIG tratta le istanze come una singola slice interconnessa. Per informazioni sulla topologia, vedi Architettura di sistema.
  • Template di istanza: definisce proprietà come il tipo di macchina, l'immagine disco e altre impostazioni per ogni VM all'interno della slice.

Disponibilità della slice e ripristino in caso di errore

Quando utilizzi i MIG per creare una slice TPU multi-host, Compute Engine gestisce automaticamente il processo di ripristino della slice. Se si verifica un errore dell'host o dell'ICI, la slice passa allo stato REACTIVATING. Tutte le VM nella slice passeranno allo stato REPAIRING, anche se non necessariamente contemporaneamente. Compute Engine recupererà automaticamente la slice riavviando le VM insieme sulla capacità integra.

Tuttavia, quando utilizzi le VM spot, il prerilascio comporta la terminazione delle istanze. In questo caso, Compute Engine non riattiva automaticamente la slice.

Ripristino in caso di errore da un'interruzione dell'istanza

Se elimini o arresti un'istanza TPU o arresti un'istanza dal sistema operativo, la slice passerà allo stato FAILED. In questo scenario, la slice rimane nello stato FAILED finché non la ricrei. Per ricreare la slice, devi eliminare e ricreare il MIG oppure ridimensionare il MIG a 0 e poi aumentarne le dimensioni.

Per ulteriori informazioni sugli stati delle slice, vedi Visualizzare lo stato di una slice TPU.

Limitazioni

I MIG con TPU presentano le seguenti limitazioni:

  • Operazioni del ciclo di vita: non puoi arrestare, avviare, riprendere o sospendere le istanze TPU. Per modificare le configurazioni che richiedono un riavvio o per interrompere l'addebito, devi eliminare le istanze.

  • Distribuzione delle zone MIG a livello di regione: devi impostare la forma di distribuzione target su ANY_SINGLE_ZONE.

  • Aggiornamenti della configurazione in un MIG:

    • Non puoi aggiornare un MIG che forma una slice TPU multi-host a causa della topologia dell'acceleratore definita.
    • Puoi aggiornare un MIG che forma slice TPU a host singolo utilizzando i metodi automatico o selettivo. Tuttavia, gli aggiornamenti per la slice TPU a host singolo non supportano l'azione di riavvio (RESTART). Se è necessario un riavvio e l'azione più invasiva consentita è la sostituzione (REPLACE), il programma di aggiornamento sostituirà l'istanza; in caso contrario, il tentativo di aggiornamento non riuscirà con un errore.

  • Per un MIG che forma una slice TPU multi-host, si applicano anche le seguenti limitazioni:

    • Policy della dimensione target: devi impostare la modalità della policy della dimensione target su BULK. Dopo aver impostato questa modalità, non puoi modificarla.

    • Dimensione target: in modalità in blocco, puoi impostare la dimensione target su 0 o il numero di istanze necessarie per formare la topologia dell'acceleratore.

    • Policy del workload: devi specificare una policy del workload in cui è definita la topologia dell'acceleratore. Dopo aver impostato la policy del workload, non puoi modificarla o rimuoverla dal MIG.

    • Riparazioni avviate dal MIG: devi disattivare le riparazioni avviate dal MIG impostando il campo defaultActionOnFailure su DO_NOTHING. In questa configurazione, il MIG non esegue alcuna azione su un'istanza non riuscita. Compute Engine recupera automaticamente l'istanza non riuscita riavviando tutte le istanze nella stessa slice sulla capacità integra.

  • Funzionalità non supportate: i MIG con TPU non supportano le seguenti funzionalità:

Passaggi successivi