Fehlerhafte Hosts mit TPUs im Modus „Alle Kapazitäten“ melden und reparieren
Wenn Sie Probleme mit einer VM im Modus „Alle Kapazitäten“ feststellen, die Sie nicht anderweitig beheben können, z. B. konstant hohe ICI-Latenzmesswerte oder eine konstant hohe Temperatur im Vergleich zu anderen VMs, empfehlen wir, den Host als fehlerhaft zu melden. Wenn Sie einen Host als fehlerhaft melden, markiert Compute Engine den Host als fehlerhaft und repariert die VM automatisch durch Ausführen der Hostwartung. Im Modus „Alle Kapazitäten“ werden TPU-VMs während der Reparatur nicht zu einem anderen Host migriert. Stattdessen werden sie auf demselben Host neu gestartet, wenn genügend Kapazität vorhanden ist. Sie können nur einen fehlerhaften Host melden, auf dem VMs ausgeführt werden.
Verwenden Sie den Befehl report-host-as-faulty, um einen fehlerhaften Host zu melden. Mit dem Parameter --fault-behavior können Sie zusätzliche Informationen zum Problem angeben.
gcloud compute instances report-host-as-faulty TPU_NAME \ --fault-reasons=behavior=FAULT_BEHAVIOR,description=DESCRIPTION \ --disruption-schedule=DISRUPTION_SCHEDULE
Ersetzen Sie Folgendes:
- TPU_NAME: Der Name der TPU-VM.
FAULT_BEHAVIOR: Sie können einen der folgenden Werte übergeben:
PERFORMANCE: Verwenden Sie diesen Wert, um eine Leistungsverschlechterung bei einer Instanz zu melden.SILENT_DATA_CORRUPTION: Verwenden Sie diesen Wert, um einen vermuteten stillen Datenverlust bei einer Instanz zu melden.BEHAVIOR_UNSPECIFIED: Verwenden Sie diesen Wert, um ein Problem zu melden, das nicht in die anderen Verhaltensgruppen passt.
DESCRIPTION: Eine Beschreibung des Problems, das Ihre VM betrifft.
DISRUPTION_SCHEDULE: Gibt den Zeitpunkt für den Beginn des Prozesses zur Meldung von Fehlern an. Der Standardwert ist
IMMEDIATE, wodurch der Prozess sofort gestartet wird.DISRUPTION_SCHEDULEmuss einer der folgenden Werte sein:IMMEDIATE,FUTURE.
Der Vorgang zum Melden eines fehlerhaften Hosts dauert in der Regel 10 bis 12 Minuten. Sobald der Meldevorgang abgeschlossen ist, beginnt die Hostreparatur innerhalb einer Minute, wenn für den Unterbrechungszeitplan IMMEDIATE festgelegt ist. Wenn für den Unterbrechungszeitplan FUTURE festgelegt ist, werden keine sofortigen Reparaturmaßnahmen ergriffen. Stattdessen plant Compute Engine eine Reparatur, wenn in Zukunft ein Fehler erkannt wird. Sobald die Reparatur gestartet wurde, wird die VM heruntergefahren. Die VM bleibt möglicherweise im Status PENDING, bis der Host repariert ist. Die Reparatur des fehlerhaften Hosts kann 3 bis 14 Tage oder länger dauern. Im Modus „Alle Kapazitäten“ werden TPU-VMs während der Reparatur nicht zu einem anderen Host migriert. Stattdessen werden sie auf demselben Host neu gestartet, wenn genügend Kapazität vorhanden ist.