Wiederherstellung nach Fehlern bei TPU-Instanzen
Damit Ihre Arbeitslasten weiter ausgeführt werden können, stellt Compute Engine TPU-Instanzen und ‑Slices nach Hardware- und Anwendungsfehlern wieder her.
Das Verhalten bei einem Fehler hängt von Ihrem Kapazitätsmodus ab:
- Modus für verwaltete Kapazität (On-Demand-, Flex-Start- und Standardreservierungen): Compute Engine stellt TPU-Instanzen und ‑Slices automatisch wieder her, indem sie auf fehlerfreier Hardware neu gestartet werden.
- Modus „Alle Kapazitäten“ (Reservierungen im Modus „Alle Kapazitäten“): Sie verwalten die Wiederherstellung von TPU-Slices. Hardwarefehler werden auf dem vorhandenen Host behoben, ohne dass Instanzen automatisch auf neue Hardware verschoben werden.
Anforderungen für die Wiederherstellung von Slices mit mehreren Hosts
Bei TPU-Slices mit mehreren Hosts müssen alle Instanzen im Slice zusammen wiederhergestellt oder neu geplant werden. Unabhängig davon, ob Compute Engine die Wiederherstellung im Modus „Verwaltete Kapazität“ automatisch übernimmt oder Sie Slices im Modus „Alle Kapazitäten“ manuell wiederherstellen, können Sie einzelne Instanzen innerhalb eines Slice nicht neu planen.
Instanzen in einem Slice mit mehreren Hosts sind über Inter-Chip-Interconnect (ICI) und in einigen Fällen über einen Optical Circuit Switch (OCS) verbunden. Wenn Sie ein Multi-Host-Slice bereitstellen, erstellt Compute Engine TPU-Instanzen und aktiviert das ICI-Netzwerk. Sie geben die Netzwerktopologie des Slice an, indem Sie die Beschleunigertopologie in Ihrer Arbeitslastrichtlinie festlegen. Wenn eine Arbeitslast gestartet wird, initialisiert LibTPU, die grundlegende TPU-Softwareschicht, die Netzwerktopologie. Standardmäßig ordnet der XLA-Compiler die Vorgänge des Modells dann statisch dieser Topologie zu.
Wenn eine Instanz oder ein Netzwerk-Link ausfällt, stimmt die physische Hardware nicht mehr mit der zugeordneten Topologie überein. Daher kann der XLA-Compiler die Arbeitslast erst ausführen, wenn das System die Netzwerktopologie neu konfiguriert, indem alle Instanzen im Slice neu erstellt oder neu geplant werden.
Fehlerbehebung im Modus mit verwalteter Kapazität
Im Modus mit verwalteter Kapazität (einschließlich On-Demand-, Flex-Start- und Standardreservierungen) werden TPU-Instanzen und ‑Slices von Compute Engine bei Hardware- und Hostfehlern automatisch wiederhergestellt, indem sie auf fehlerfreier Hardware neu gestartet werden.
Automatische Wiederherstellung eines TPU-Slice mit einem Host
Slices mit einem einzelnen Host sind unabhängige TPU-Instanzen. Standardmäßig stellt Compute Engine fehlgeschlagene Instanzen automatisch wieder her, indem sie die Instanzen auf fehlerfreier Hardware neu startet. Dieses Verhalten wird durch die Einstellung für den automatischen Neustart gesteuert, die beim Erstellen von Instanzen standardmäßig aktiviert ist, mit Ausnahme von Spot-VMs. Wenn Sie den automatischen Neustart deaktivieren, wechselt die Instanz bei einem Fehler in den Status TERMINATED. Weitere Informationen finden Sie unter Automatischer Neustart.
Compute Engine stellt eine fehlgeschlagene Instanz in folgenden Szenarien automatisch wieder her:
- Eine Zeitüberschreitung oder ein Fehler des Hosts, der dadurch verursacht wird, dass die physische Maschine nicht reagiert, der Host heruntergefahren oder neu gestartet wird oder ein Stromausfall des Hosts auftritt
- Wartungsereignisse für physische Hosts, die von Ihnen oder Google initiiert werden
- ICI-Fehler (Inter-Chip Interconnect) innerhalb eines Hosts
- VM-Absturz
Compute Engine stellt Instanzen in Szenarien mit geplanter Beendigung nicht automatisch wieder her, darunter:
- Instanz löschen
- Löschen oder Ablauf von Reservierungen
- Vorzeitiges Beenden von Spot-VMs
Von MIG initiierte Reparatur in Single-Host-Slices
Wenn in einer MIG mit Single-Host-Slices eine TPU-Instanz in einem Single-Host-Slice aufgrund von Hardwarefehlern oder externen Ereignissen wie dem vorzeitigen Beenden von Spot-VMs den Status TERMINATED erreicht, wird die Instanz standardmäßig von der MIG repariert.
Während einer Reparatur erstellt die MIG die Instanz mit demselben Namen neu. Sie können diesen Reparaturmechanismus deaktivieren, indem Sie Reparaturen deaktivieren.
Sie können auch eine anwendungsbasierte Systemdiagnose in einer MIG mit Single-Host-Slices einrichten. Wenn bei der Systemdiagnose festgestellt wird, dass Ihre Anwendung nicht reagiert, markiert die MIG die Instanz als fehlerhaft und führt eine automatische Reparatur durch, indem sie die Instanz neu erstellt.
Weitere Informationen finden Sie unter VMs für Hochverfügbarkeit reparieren und Systemdiagnose und automatische Reparatur einer Anwendung einrichten.
Automatische Wiederherstellung eines Multi-Host-Slices
Bei TPUs im verwalteten Modus, die die Verbrauchsmodelle „On-Demand“, „Flex-Start“ oder „Reservierung“ verwenden, stellt Compute Engine fehlgeschlagene Instanzen in einem Slice mit mehreren Hosts automatisch wieder her.
Bei der Wiederherstellung identifiziert Compute Engine eine Reihe von TPU-Maschinen, die die Netzwerktopologie bilden können, startet alle Instanzen im Slice gemeinsam auf diesen Maschinen neu und konfiguriert das Netzwerk neu. Dadurch werden Ausfallzeiten minimiert, da die Topologie auf verfügbarer, funktionierender Hardware neu erstellt wird, anstatt auf Hardware-Reparaturen zu warten.
Wiederherstellungsprozess und Slice-Status
Während der automatischen Wiederherstellung durchläuft der Slice die folgenden Status:
- Der Slice wechselt in den Status
REACTIVATING. - Alle Instanzen im Slice wechseln in den Status
REPAIRING, jedoch nicht unbedingt gleichzeitig. - Compute Engine startet alle Instanzen im Slice gemeinsam auf fehlerfreier Hardware neu.
Weitere Informationen zu TPU-Slice-Status finden Sie unter Status der Beschleunigertopologie.
Szenarien, die eine manuelle Slice-Wiederherstellung im Modus mit verwalteter Kapazität erfordern
Compute Engine kann ein Multi-Host-Slice in den folgenden Szenarien nicht automatisch wiederherstellen:
- Vorzeitiges Beenden von Spot-VMs: Wenn eine Instanz im Slice vorzeitig beendet wird, beendet Compute Engine alle Instanzen im Slice und der Slice wechselt in den Status
FAILED. - Vom Nutzer initiierte Unterbrechungen: Wenn Sie eine TPU-Instanz beenden oder löschen oder eine Instanz über das Betriebssystem beenden, wechselt der Slice in den Status
FAILED. Das Segment bleibt im StatusFAILED, bis Sie es neu erstellen.
In diesen Fällen müssen Sie das Segment manuell wiederherstellen.
Fehlerbehebung im Modus „Alle Kapazitäten“
Im Modus „All Capacity“ sind Sie für die Verwaltung des TPU-Slice-Wiederherstellungsprozesses verantwortlich. Im Gegensatz zum Modus mit verwalteter Kapazität werden fehlgeschlagene TPU-Instanzen oder Multi-Host-Slices nicht automatisch auf neue physische Hardware verschoben. Google repariert die zugrunde liegende ausgefallene Hardware auf dem vorhandenen Host. Sie sind dafür verantwortlich, fehlerhafte Slices auf gesunde Ersatzhardware umzuplanen, die Sie in Ihrer Reservierung reserviert haben.
Hostausfall und Reparatur fehlerhafter Hosts
Wenn ein Host ausfällt oder Sie einen VM-Host als fehlerhaft melden, läuft die Hostreparatur so ab:
- Die betroffene VM wechselt in den Status
REPAIRING, während die physische Hardware repariert wird. - Sobald die zugrunde liegende Hardware repariert ist, wechselt die VM auf demselben Host wieder in den Status
RUNNING. Wenn die VM jedoch zu einem Slice mit mehreren Hosts gehört, bleibt der Slice im Status „FAILED“. Sie müssen den Slice manuell wiederherstellen.
Weitere Informationen finden Sie unter Fehlerhafte TPU-Hosts im Modus „All Capacity“ melden und reparieren.
Notfallwartung
Während dringender Wartungsereignisse oder wenn Sie ein Wartungsereignis manuell starten:
- Die VMs wechseln vom Status
RUNNINGin den StatusREPAIRING. - Nach Abschluss der Wartung kehren die VMs auf demselben Host in den Status
RUNNINGzurück.
Weitere Informationen finden Sie unter Wartungsereignisse im Modus „Alle Kapazitäten“ verwalten.
Fehlerszenarien für Slices mit mehreren Hosts
Im Modus „All Capacity“ stellt Compute Engine einen Multi-Host-Slice nicht automatisch wieder her. Ein Segment wechselt in den Status FAILED, wenn einer der folgenden Fälle eintritt:
- ICI-Fehler: Die VMs bleiben im Status
RUNNING, aber der Slice-Status wechselt in den StatusFAILED. - Vorzeitiges Beenden von Spot-VMs: Wenn eine Instanz im Slice vorzeitig beendet wird, beendet Compute Engine alle Instanzen im Slice und der Slice wechselt in den Status
FAILED. - Vom Nutzer initiierte Unterbrechungen: Wenn Sie eine TPU-Instanz beenden oder löschen oder eine Instanz über das Betriebssystem beenden, wechselt der Slice in den Status
FAILED.
Wenn ein Slice in den Status FAILED wechselt, müssen Sie ihn manuell wiederherstellen, indem Sie alle Instanzen im Slice neu planen.
TPU-Slice manuell wiederherstellen
Wenn sich ein TPU-Slice im Modus „Verwaltete Kapazität“ oder „Alle Kapazitäten“ im Status FAILED befindet, müssen Sie ihn manuell wiederherstellen, indem Sie alle Instanzen im Slice mit einer der folgenden Methoden neu planen:
- Passen Sie die Größe der MIG an die Zielgröße
0an und erhöhen Sie sie dann auf die erforderliche Größe. - Löschen Sie die MIG und erstellen Sie den Slice neu.
Nächste Schritte
Prüfen Sie die folgenden Status, um die Fehlerbehebung von TPUs zu überprüfen: