TPU 인스턴스 장애 복구

워크로드를 계속 실행하기 위해 Compute Engine은 하드웨어 및 애플리케이션 장애로부터 TPU 인스턴스와 슬라이스를 복구합니다.

실패 복구 동작은 용량 모드에 따라 다릅니다.

  • 관리형 용량 모드 (온디맨드, 유연한 시작, 표준 예약): Compute Engine이 정상 하드웨어에서 TPU 인스턴스와 슬라이스를 다시 시작하여 자동으로 복구합니다.
  • 모든 용량 모드 (모든 용량 모드의 예약): TPU 슬라이스 복구를 관리합니다. 인스턴스를 새 하드웨어로 자동 이전하지 않고 기존 호스트에서 하드웨어 장애가 복구됩니다.

멀티 호스트 슬라이스 복구 요구사항

멀티 호스트 TPU 슬라이스에서는 슬라이스의 모든 인스턴스를 함께 복구하거나 다시 예약해야 합니다. 관리형 용량 모드에서 Compute Engine이 자동으로 복구를 처리하든 모든 용량 모드에서 슬라이스를 수동으로 복구하든 슬라이스 내에서 개별 인스턴스를 재예약할 수는 없습니다.

멀티 호스트 슬라이스의 인스턴스는 칩 간 상호 연결 (ICI)과 경우에 따라 광 회로 스위치 (OCS)로 연결됩니다. 멀티 호스트 슬라이스를 프로비저닝하면 Compute Engine에서 TPU 인스턴스를 만들고 ICI 네트워크를 활성화합니다. 워크로드 정책에서 가속기 토폴로지를 설정하여 슬라이스의 네트워크 토폴로지를 지정합니다. 워크로드가 시작되면 기본 TPU 소프트웨어 레이어인 LibTPU가 네트워크 토폴로지를 초기화합니다. 그러면 기본적으로 XLA 컴파일러가 모델의 작업을 이 토폴로지에 정적으로 매핑합니다.

인스턴스 또는 네트워크 링크가 실패하면 물리적 하드웨어가 더 이상 매핑된 토폴로지와 일치하지 않습니다. 따라서 시스템이 슬라이스의 모든 인스턴스를 다시 만들거나 다시 예약하여 네트워크 토폴로지를 재구성할 때까지 XLA 컴파일러는 워크로드를 실행할 수 없습니다.

관리형 용량 모드에서의 장애 복구

관리형 용량 모드 (온디맨드, 플렉스 시작, 표준 예약 포함)에서 Compute Engine은 정상 하드웨어에서 다시 시작하여 하드웨어 및 호스트 오류로부터 TPU 인스턴스와 슬라이스를 자동으로 복구합니다.

단일 호스트 TPU 슬라이스의 자동 복구

단일 호스트 슬라이스는 독립적인 TPU 인스턴스입니다. 기본적으로 Compute Engine은 정상 하드웨어에서 인스턴스를 다시 시작하여 실패한 인스턴스를 자동으로 복구합니다. 이 동작은 스팟 VM을 제외한 인스턴스를 만들 때 기본적으로 사용 설정되는 자동 다시 시작 설정에 의해 제어됩니다. 자동 다시 시작을 사용 중지하면 인스턴스 장애로 인해 인스턴스가 TERMINATED 상태로 전환됩니다. 자세한 내용은 자동 다시 시작을 참고하세요.

Compute Engine은 다음과 같은 시나리오에서 실패한 인스턴스를 자동으로 복구합니다.

  • 물리적 머신이 응답하지 않거나 호스트 종료, 호스트 재부팅, 호스트 전원 장애로 인해 발생하는 호스트 제한 시간 또는 오류
  • 사용자 또는 Google에서 시작한 물리적 호스트 유지보수 이벤트
  • 호스트 내 칩 간 상호 연결 (ICI) 오류
  • VM 비정상 종료

Compute Engine은 다음을 비롯한 계획된 종료 시나리오에서 인스턴스를 자동으로 복구하지 않습니다.

  • 인스턴스 삭제
  • 예약 삭제 또는 만료
  • 스팟 VM 선점

단일 호스트 슬라이스에서 MIG 시작 복구

단일 호스트 슬라이스가 있는 MIG에서 단일 호스트 슬라이스의 TPU 인스턴스가 하드웨어 장애 또는 스팟 VM 선점과 같은 외부 이벤트로 인해 TERMINATED 상태가 되면 MIG에서 기본적으로 인스턴스를 복구합니다. 복구 중에 MIG는 동일한 이름으로 인스턴스를 다시 만듭니다. 수리를 사용 중지하면 이 수리 메커니즘을 사용 중지할 수 있습니다.

단일 호스트 슬라이스가 있는 MIG에서 애플리케이션 기반 상태 점검을 설정할 수도 있습니다. 상태 점검에서 애플리케이션이 응답하지 않는 것으로 확인되면 MIG는 인스턴스를 비정상으로 표시하고 인스턴스를 다시 만들어 자동 복구합니다.

자세한 내용은 고가용성을 위한 VM 복구 정보 및 애플리케이션 상태 점검 및 자동 복구 설정을 참고하세요.

멀티 호스트 슬라이스의 자동 복구

온디맨드, flex-start 또는 예약 소비 모델을 사용하는 관리 모드의 TPU의 경우 Compute Engine이 멀티 호스트 슬라이스에서 실패한 인스턴스를 자동으로 복구합니다.

복구 중에 Compute Engine은 네트워크 토폴로지를 형성할 수 있는 TPU 머신 집합을 식별하고, 해당 머신에서 슬라이스의 모든 인스턴스를 함께 다시 시작하고, 네트워크를 재구성합니다. 이 프로세스는 하드웨어 수리를 기다리는 대신 사용 가능한 정상 하드웨어에서 토폴로지를 다시 만들어 다운타임을 최소화합니다.

복구 프로세스 및 슬라이스 상태

자동 복구 중에 슬라이스는 다음 상태를 거칩니다.

  1. 슬라이스가 REACTIVATING 상태로 전환됩니다.
  2. 슬라이스의 모든 인스턴스가 REPAIRING 상태로 전환됩니다(반드시 동시에 전환되는 것은 아님).
  3. Compute Engine은 정상적인 하드웨어에서 슬라이스의 모든 인스턴스를 함께 다시 시작합니다.

TPU 슬라이스 상태에 대한 자세한 내용은 액셀러레이터 토폴로지 상태를 참고하세요.

관리형 용량 모드에서 수동 슬라이스 복구가 필요한 시나리오

다음 시나리오에서는 Compute Engine이 멀티 호스트 슬라이스를 자동으로 복구할 수 없습니다.

  • 스팟 VM 선점: 슬라이스의 인스턴스가 선점되면 Compute Engine은 슬라이스의 모든 인스턴스를 종료하고 슬라이스가 FAILED 상태가 됩니다.
  • 사용자 시작 중단: TPU 인스턴스를 중지하거나 삭제하거나 운영체제 내에서 인스턴스를 중지하면 슬라이스가 FAILED 상태로 전환됩니다. 슬라이스는 다시 만들 때까지 FAILED 상태로 유지됩니다.

이러한 시나리오에서는 슬라이스를 수동으로 복구해야 합니다.

모든 용량 모드에서의 장애 복구

모든 용량 모드에서는 TPU 슬라이스 복구 프로세스를 관리할 책임이 사용자에게 있습니다. 관리형 용량 모드와 달리 Compute Engine은 실패한 TPU 인스턴스나 멀티 호스트 슬라이스를 새 실제 하드웨어로 자동 재배치하지 않습니다. Google은 기존 호스트에서 기본 실패 하드웨어를 수리하며, 예약 시 확보한 정상 예비 하드웨어로 비정상 슬라이스를 재예약하는 것은 사용자의 책임입니다.

호스트 장애 및 장애가 있는 호스트 복구

호스트 장애가 발생하거나 VM 호스트에 장애가 있다고 신고하면 호스트 복구 프로세스는 다음과 같이 작동합니다.

  • 영향을 받는 VM은 물리적 하드웨어가 복구되는 동안 REPAIRING 상태로 전환됩니다.
  • 기본 하드웨어가 수정되면 VM이 동일한 호스트에서 RUNNING 상태로 다시 전환됩니다. 하지만 VM이 멀티 호스트 슬라이스에 속하는 경우 슬라이스는 'FAILED' 상태로 유지됩니다. 슬라이스를 수동으로 복구해야 합니다.

자세한 내용은 모든 용량 모드에서 장애가 있는 TPU 호스트 신고 및 복구를 참고하세요.

긴급 유지보수

긴급 유지보수 이벤트 중 또는 유지보수 이벤트를 수동으로 시작하는 경우:

  • VM이 RUNNING 상태에서 REPAIRING 상태로 전환됩니다.
  • 유지보수가 완료되면 VM이 동일한 호스트에서 RUNNING 상태로 돌아갑니다.

자세한 내용은 모든 용량 모드에서 유지보수 이벤트 관리를 참고하세요.

멀티 호스트 슬라이스 실패 시나리오

모든 용량 모드에서는 Compute Engine이 멀티 호스트 슬라이스를 자동으로 복구하지 않습니다. 다음 시나리오에서 슬라이스가 FAILED 상태로 전환됩니다.

  • ICI 실패: VM은 RUNNING 상태로 유지되지만 슬라이스 상태는 FAILED 상태로 전환됩니다.
  • 스팟 VM 선점: 슬라이스의 인스턴스가 선점되면 Compute Engine은 슬라이스의 모든 인스턴스를 종료하고 슬라이스가 FAILED 상태가 됩니다.
  • 사용자 시작 중단: TPU 인스턴스를 중지하거나 삭제하거나 운영체제 내에서 인스턴스를 중지하면 슬라이스가 FAILED 상태로 전환됩니다.

슬라이스가 FAILED 상태가 되면 슬라이스의 모든 인스턴스를 다시 예약하여 슬라이스를 수동으로 복구해야 합니다.

TPU 슬라이스 수동 복구

관리형 용량 모드 또는 모든 용량 모드의 TPU 슬라이스가 FAILED 상태인 경우 다음 방법 중 하나를 사용하여 슬라이스의 모든 인스턴스를 다시 예약하여 수동으로 복구해야 합니다.

다음 단계

TPU의 장애 복구를 확인하려면 다음 상태를 확인하세요.