Wiederherstellung nach Fehlern bei TPU-Instanzen

Damit Ihre Arbeitslasten weiter ausgeführt werden können, stellt Compute Engine TPU-Instanzen und ‑Slices nach Hardware- und Anwendungsfehlern wieder her.

Das Verhalten bei einem Fehler hängt von Ihrem Kapazitätsmodus ab:

  • Modus für verwaltete Kapazität (On-Demand-, Flex-Start- und Standardreservierungen): Compute Engine stellt TPU-Instanzen und ‑Slices automatisch wieder her, indem sie auf fehlerfreier Hardware neu gestartet werden.
  • Modus „Alle Kapazitäten“ (Reservierungen im Modus „Alle Kapazitäten“): Sie verwalten die Wiederherstellung von TPU-Slices. Hardwarefehler werden auf dem vorhandenen Host behoben, ohne dass Instanzen automatisch auf neue Hardware verschoben werden.

Anforderungen für die Wiederherstellung von Slices mit mehreren Hosts

Bei TPU-Slices mit mehreren Hosts müssen alle Instanzen im Slice zusammen wiederhergestellt oder neu geplant werden. Unabhängig davon, ob Compute Engine die Wiederherstellung im Modus „Verwaltete Kapazität“ automatisch übernimmt oder Sie Slices im Modus „Alle Kapazitäten“ manuell wiederherstellen, können Sie einzelne Instanzen innerhalb eines Slice nicht neu planen.

Instanzen in einem Slice mit mehreren Hosts sind über Inter-Chip-Interconnect (ICI) und in einigen Fällen über einen Optical Circuit Switch (OCS) verbunden. Wenn Sie ein Multi-Host-Slice bereitstellen, erstellt Compute Engine TPU-Instanzen und aktiviert das ICI-Netzwerk. Sie geben die Netzwerktopologie des Slice an, indem Sie die Beschleunigertopologie in Ihrer Arbeitslastrichtlinie festlegen. Wenn eine Arbeitslast gestartet wird, initialisiert LibTPU, die grundlegende TPU-Softwareschicht, die Netzwerktopologie. Standardmäßig ordnet der XLA-Compiler die Vorgänge des Modells dann statisch dieser Topologie zu.

Wenn eine Instanz oder ein Netzwerk-Link ausfällt, stimmt die physische Hardware nicht mehr mit der zugeordneten Topologie überein. Daher kann der XLA-Compiler die Arbeitslast erst ausführen, wenn das System die Netzwerktopologie neu konfiguriert, indem alle Instanzen im Slice neu erstellt oder neu geplant werden.

Fehlerbehebung im Modus mit verwalteter Kapazität

Im Modus mit verwalteter Kapazität (einschließlich On-Demand-, Flex-Start- und Standardreservierungen) werden TPU-Instanzen und ‑Slices von Compute Engine bei Hardware- und Hostfehlern automatisch wiederhergestellt, indem sie auf fehlerfreier Hardware neu gestartet werden.

Automatische Wiederherstellung eines TPU-Slice mit einem Host

Slices mit einem einzelnen Host sind unabhängige TPU-Instanzen. Standardmäßig stellt Compute Engine fehlgeschlagene Instanzen automatisch wieder her, indem sie die Instanzen auf fehlerfreier Hardware neu startet. Dieses Verhalten wird durch die Einstellung für den automatischen Neustart gesteuert, die beim Erstellen von Instanzen standardmäßig aktiviert ist, mit Ausnahme von Spot-VMs. Wenn Sie den automatischen Neustart deaktivieren, wechselt die Instanz bei einem Fehler in den Status TERMINATED. Weitere Informationen finden Sie unter Automatischer Neustart.

Compute Engine stellt eine fehlgeschlagene Instanz in folgenden Szenarien automatisch wieder her:

  • Eine Zeitüberschreitung oder ein Fehler des Hosts, der dadurch verursacht wird, dass die physische Maschine nicht reagiert, der Host heruntergefahren oder neu gestartet wird oder ein Stromausfall des Hosts auftritt
  • Wartungsereignisse für physische Hosts, die von Ihnen oder Google initiiert werden
  • ICI-Fehler (Inter-Chip Interconnect) innerhalb eines Hosts
  • VM-Absturz

Compute Engine stellt Instanzen in Szenarien mit geplanter Beendigung nicht automatisch wieder her, darunter:

  • Instanz löschen
  • Löschen oder Ablauf von Reservierungen
  • Vorzeitiges Beenden von Spot-VMs

Von MIG initiierte Reparatur in Single-Host-Slices

Wenn in einer MIG mit Single-Host-Slices eine TPU-Instanz in einem Single-Host-Slice aufgrund von Hardwarefehlern oder externen Ereignissen wie dem vorzeitigen Beenden von Spot-VMs den Status TERMINATED erreicht, wird die Instanz standardmäßig von der MIG repariert. Während einer Reparatur erstellt die MIG die Instanz mit demselben Namen neu. Sie können diesen Reparaturmechanismus deaktivieren, indem Sie Reparaturen deaktivieren.

Sie können auch eine anwendungsbasierte Systemdiagnose in einer MIG mit Single-Host-Slices einrichten. Wenn bei der Systemdiagnose festgestellt wird, dass Ihre Anwendung nicht reagiert, markiert die MIG die Instanz als fehlerhaft und führt eine automatische Reparatur durch, indem sie die Instanz neu erstellt.

Weitere Informationen finden Sie unter VMs für Hochverfügbarkeit reparieren und Systemdiagnose und automatische Reparatur einer Anwendung einrichten.

Automatische Wiederherstellung eines Multi-Host-Slices

Bei TPUs im verwalteten Modus, die die Verbrauchsmodelle „On-Demand“, „Flex-Start“ oder „Reservierung“ verwenden, stellt Compute Engine fehlgeschlagene Instanzen in einem Slice mit mehreren Hosts automatisch wieder her.

Bei der Wiederherstellung identifiziert Compute Engine eine Reihe von TPU-Maschinen, die die Netzwerktopologie bilden können, startet alle Instanzen im Slice gemeinsam auf diesen Maschinen neu und konfiguriert das Netzwerk neu. Dadurch werden Ausfallzeiten minimiert, da die Topologie auf verfügbarer, funktionierender Hardware neu erstellt wird, anstatt auf Hardware-Reparaturen zu warten.

Wiederherstellungsprozess und Slice-Status

Während der automatischen Wiederherstellung durchläuft der Slice die folgenden Status:

  1. Der Slice wechselt in den Status REACTIVATING.
  2. Alle Instanzen im Slice wechseln in den Status REPAIRING, jedoch nicht unbedingt gleichzeitig.
  3. Compute Engine startet alle Instanzen im Slice gemeinsam auf fehlerfreier Hardware neu.

Weitere Informationen zu TPU-Slice-Status finden Sie unter Status der Beschleunigertopologie.

Szenarien, die eine manuelle Slice-Wiederherstellung im Modus mit verwalteter Kapazität erfordern

Compute Engine kann ein Multi-Host-Slice in den folgenden Szenarien nicht automatisch wiederherstellen:

  • Vorzeitiges Beenden von Spot-VMs: Wenn eine Instanz im Slice vorzeitig beendet wird, beendet Compute Engine alle Instanzen im Slice und der Slice wechselt in den Status FAILED.
  • Vom Nutzer initiierte Unterbrechungen: Wenn Sie eine TPU-Instanz beenden oder löschen oder eine Instanz über das Betriebssystem beenden, wechselt der Slice in den Status FAILED. Das Segment bleibt im Status FAILED, bis Sie es neu erstellen.

In diesen Fällen müssen Sie das Segment manuell wiederherstellen.

Fehlerbehebung im Modus „Alle Kapazitäten“

Im Modus „All Capacity“ sind Sie für die Verwaltung des TPU-Slice-Wiederherstellungsprozesses verantwortlich. Im Gegensatz zum Modus mit verwalteter Kapazität werden fehlgeschlagene TPU-Instanzen oder Multi-Host-Slices nicht automatisch auf neue physische Hardware verschoben. Google repariert die zugrunde liegende ausgefallene Hardware auf dem vorhandenen Host. Sie sind dafür verantwortlich, fehlerhafte Slices auf gesunde Ersatzhardware umzuplanen, die Sie in Ihrer Reservierung reserviert haben.

Hostausfall und Reparatur fehlerhafter Hosts

Wenn ein Host ausfällt oder Sie einen VM-Host als fehlerhaft melden, läuft die Hostreparatur so ab:

  • Die betroffene VM wechselt in den Status REPAIRING, während die physische Hardware repariert wird.
  • Sobald die zugrunde liegende Hardware repariert ist, wechselt die VM auf demselben Host wieder in den Status RUNNING. Wenn die VM jedoch zu einem Slice mit mehreren Hosts gehört, bleibt der Slice im Status „FAILED“. Sie müssen den Slice manuell wiederherstellen.

Weitere Informationen finden Sie unter Fehlerhafte TPU-Hosts im Modus „All Capacity“ melden und reparieren.

Notfallwartung

Während dringender Wartungsereignisse oder wenn Sie ein Wartungsereignis manuell starten:

  • Die VMs wechseln vom Status RUNNING in den Status REPAIRING.
  • Nach Abschluss der Wartung kehren die VMs auf demselben Host in den Status RUNNING zurück.

Weitere Informationen finden Sie unter Wartungsereignisse im Modus „Alle Kapazitäten“ verwalten.

Fehlerszenarien für Slices mit mehreren Hosts

Im Modus „All Capacity“ stellt Compute Engine einen Multi-Host-Slice nicht automatisch wieder her. Ein Segment wechselt in den Status FAILED, wenn einer der folgenden Fälle eintritt:

  • ICI-Fehler: Die VMs bleiben im Status RUNNING, aber der Slice-Status wechselt in den Status FAILED.
  • Vorzeitiges Beenden von Spot-VMs: Wenn eine Instanz im Slice vorzeitig beendet wird, beendet Compute Engine alle Instanzen im Slice und der Slice wechselt in den Status FAILED.
  • Vom Nutzer initiierte Unterbrechungen: Wenn Sie eine TPU-Instanz beenden oder löschen oder eine Instanz über das Betriebssystem beenden, wechselt der Slice in den Status FAILED.

Wenn ein Slice in den Status FAILED wechselt, müssen Sie ihn manuell wiederherstellen, indem Sie alle Instanzen im Slice neu planen.

TPU-Slice manuell wiederherstellen

Wenn sich ein TPU-Slice im Modus „Verwaltete Kapazität“ oder „Alle Kapazitäten“ im Status FAILED befindet, müssen Sie ihn manuell wiederherstellen, indem Sie alle Instanzen im Slice mit einer der folgenden Methoden neu planen:

Nächste Schritte

Prüfen Sie die folgenden Status, um die Fehlerbehebung von TPUs zu überprüfen: