Recupero dagli errori delle istanze TPU

Per mantenere in esecuzione i tuoi carichi di lavoro, Compute Engine recupera le istanze e gli slice TPU da errori hardware e delle applicazioni.

Il comportamento di recupero in caso di errore dipende dalla modalità di capacità:

  • Modalità capacità gestita (prenotazioni on demand, avvio flessibile e standard): Compute Engine recupera automaticamente le istanze e gli slice TPU riavviandoli su hardware integro.
  • Modalità All Capacity (prenotazioni in modalità All Capacity): gestisci il recupero delle slice TPU. Gli errori hardware vengono riparati sull'host esistente senza spostare automaticamente le istanze su un nuovo hardware.

Requisiti di recupero delle sezioni multihost

Gli slice TPU multi-host richiedono che tutte le istanze dello slice vengano recuperate o riprogrammate insieme. Indipendentemente dal fatto che Compute Engine gestisca automaticamente il recupero in modalità capacità gestita o che tu recuperi manualmente le sezioni in modalità tutta la capacità, non puoi riprogrammare le singole istanze all'interno di una sezione.

Le istanze in una sezione multihost sono connesse tramite Inter-Chip Interconnect (ICI) e, in alcuni casi, tramite un Optical Circuit Switch (OCS). Quando esegui il provisioning di una sezione multihost, Compute Engine crea istanze TPU e attiva la rete ICI. Specifichi la topologia di rete della sezione impostando la topologia dell'acceleratore nella policy del workload. Quando un workload viene avviato, LibTPU, il livello software TPU di base, inizializza la topologia di rete. Per impostazione predefinita, il compilatore XLA mappa staticamente le operazioni del modello a questa topologia.

Se un'istanza o un link di rete non va a buon fine, l'hardware fisico non corrisponde più alla topologia mappata. Di conseguenza, il compilatore XLA non può eseguire il carico di lavoro finché il sistema non riconfigura la topologia di rete ricreando o ripianificando tutte le istanze nella sezione.

Recupero in caso di errore in modalità di capacità gestita

In modalità di capacità gestita (incluse le prenotazioni on demand, avvio flessibile e standard), Compute Engine recupera automaticamente le istanze e gli slice TPU da errori hardware e host riavviandoli su hardware integro.

Recupero automatico di una slice TPU single-host

Le slice a host singolo sono istanze TPU indipendenti. Per impostazione predefinita, Compute Engine recupera automaticamente le istanze non riuscite riavviandole su hardware integro. Questo comportamento è controllato dall'impostazione di riavvio automatico, che è attivata per impostazione predefinita durante la creazione delle istanze, ad eccezione delle VM spot. Se disattivi il riavvio automatico, un errore dell'istanza fa sì che l'istanza entri nello stato TERMINATED. Per saperne di più, consulta Riavvio automatico.

Compute Engine recupera automaticamente un'istanza non riuscita in scenari come:

  • Un timeout o un errore dell'host causato dalla mancata risposta della macchina fisica, dall'arresto, dal riavvio o dall'interruzione dell'alimentazione dell'host
  • Eventi di manutenzione dell'host fisico avviati da te o da Google
  • Errore di interconnessione tra chip (ICI) all'interno di un host
  • Arresto anomalo della VM

Compute Engine non recupera automaticamente le istanze negli scenari di terminazione pianificata, tra cui:

  • Eliminazione dell'istanza
  • Eliminazione o scadenza della prenotazione
  • Prerilascio delle VM spot

Riparazione avviata dal MIG nelle sezioni a singolo host

In un MIG con slice a host singolo, se un'istanza TPU in uno slice a host singolo entra nello stato TERMINATED a causa di guasti hardware o eventi esterni come il prerilascio delle VM spot, il MIG ripara l'istanza per impostazione predefinita. Durante una riparazione, il MIG ricrea l'istanza con lo stesso nome. Puoi disattivare questo meccanismo di riparazione se disattivi le riparazioni.

Puoi anche configurare un controllo di integrità basato su applicazione in un MIG con slice a singolo host. Se il controllo di integrità rileva che l'applicazione non risponde, il MIG contrassegna l'istanza come non integra e la ripara automaticamente ricreandola.

Per ulteriori informazioni, consulta Informazioni sulla riparazione delle VM per l'alta affidabilità e Configura un controllo di integrità e il ripristino automatico basati sull'applicazione.

Recupero automatico di uno slice multihost

Per le TPU in modalità gestita che utilizzano i modelli di consumo on demand, avvio flessibile o di prenotazione, Compute Engine recupera automaticamente le istanze non riuscite in uno slice multi-host.

Durante il ripristino, Compute Engine identifica un insieme di macchine TPU che possono formare la topologia di rete, riavvia tutte le istanze nello slice insieme su queste macchine e riconfigura la rete. Questo processo riduce al minimo i tempi di inattività ricreando la topologia sull'hardware integro disponibile, anziché attendere le riparazioni dell'hardware.

Procedura di recupero e stati delle sezioni

Durante il recupero automatico, lo slice passa attraverso i seguenti stati:

  1. La sezione passa allo stato REACTIVATING.
  2. Tutte le istanze nella transizione della sezione passano allo stato REPAIRING, anche se non necessariamente nello stesso momento.
  3. Compute Engine riavvia tutte le istanze nella sezione insieme su hardware integro.

Per ulteriori informazioni sugli stati delle sezioni TPU, consulta Stati della topologia dell'acceleratore.

Scenari che richiedono il recupero manuale delle sezioni in modalità con capacità gestita

Compute Engine non può recuperare automaticamente una sezione multihost nei seguenti scenari:

  • Preemption delle VM spot: se viene eseguito il prerilascio di un'istanza nella sezione, Compute Engine termina tutte le istanze nella sezione e la sezione entra nello stato FAILED.
  • Interruzioni avviate dall'utente: se arresti o elimini un'istanza TPU oppure arresti un'istanza dal sistema operativo, lo slice entra nello stato FAILED. La sezione rimane nello stato FAILED finché non la ricrei.

In questi scenari, devi recuperare manualmente la fetta.

Recupero in caso di errore in modalità Tutta la capacità

Nella modalità All Capacity, sei responsabile della gestione del processo di recupero dello slice TPU. A differenza della modalità di capacità gestita, Compute Engine non riposiziona automaticamente le istanze TPU o le sezioni multihost non riuscite su un nuovo hardware fisico. Google ripara l'hardware sottostante non funzionante sull'host esistente e tu sei responsabile della riprogrammazione delle sezioni non integre sull'hardware di ricambio integro che hai messo da parte nella prenotazione.

Errore dell'host e riparazione dell'host difettoso

Se si verifica un errore dell'host o se segnali un host VM come difettoso, la procedura di riparazione dell'host funziona nel seguente modo:

  • La VM interessata passa allo stato REPAIRING mentre l'hardware fisico viene riparato.
  • Una volta riparato l'hardware sottostante, la VM torna allo stato RUNNING sullo stesso host. Tuttavia, se la VM appartiene a una sezione multi-host, la sezione rimane nello stato "FAILED" (ERRORE). Devi recuperare manualmente la sezione.

Per ulteriori informazioni, consulta Segnala e ripara gli host TPU difettosi in modalità Tutta la capacità.

Manutenzione emergente

Durante gli eventi di manutenzione di emergenza o quando avvii manualmente un evento di manutenzione:

  • Le VM passano dallo stato RUNNING allo stato REPAIRING.
  • Al termine della manutenzione, le VM tornano allo stato RUNNING sullo stesso host.

Per saperne di più, vedi Gestire gli eventi di manutenzione in modalità Tutta la capacità.

Scenari di errore dello slice multi-host

Nella modalità All Capacity, Compute Engine non recupera automaticamente una sezione multihost. Una sezione passa allo stato FAILED nei seguenti scenari:

  • Errore ICI: le VM rimangono nello stato RUNNING, ma lo stato della slice passa allo stato FAILED.
  • Preemption delle VM spot: se viene eseguito il prerilascio di un'istanza nella sezione, Compute Engine termina tutte le istanze nella sezione e la sezione entra nello stato FAILED.
  • Interruzioni avviate dall'utente: se arresti o elimini un'istanza TPU oppure arresti un'istanza dal sistema operativo, lo slice entra nello stato FAILED.

Quando una sezione entra nello stato FAILED, devi recuperarla manualmente riprogrammandone tutte le istanze.

Recuperare manualmente una slice TPU

Quando una sezione TPU in modalità con capacità gestita o in modalità con tutta la capacità si trova nello stato FAILED, devi ripristinarla manualmente riprogrammandone tutte le istanze utilizzando uno dei seguenti metodi:

Passaggi successivi

Per verificare il ripristino in caso di errore delle TPU, controlla i seguenti stati: