TPU 용량 모드

TPU는 관리형 용량 모드와 모든 용량 모드라는 두 가지 용량 모드를 제공합니다. 각 모드는 하드웨어 유지보수 및 호스트 오류가 처리되는 방식과 TPU 하드웨어 토폴로지에 대한 가시성 및 제어 수준을 정의합니다.

TPU 용량 모드 개요

다음 표에는 관리형 용량 모드와 모든 용량 모드의 주요 차이점이 요약되어 있습니다.

관리형 용량 모드 모든 용량 모드
용량 액세스 Google은 사용 가능한 인프라 전반에서 용량 할당 및 호스트 복구를 관리합니다. 예약된 용량의 100% 를 워크로드에 액세스할 수 있습니다. 장애 복구를 위한 예비 용량 관리는 사용자의 책임입니다. 정확한 토폴로지 인식 워크로드 배치를 위해 특정 블록 또는 하위 블록을 타겟팅할 수 있습니다.
하드웨어 토폴로지 공개 상태 Compute Engine은 물리적 토폴로지를 추상화합니다. 클러스터, 블록, 하위 블록, 호스트 토폴로지 및 사용률을 완전히 파악할 수 있습니다.
오류 복구 Compute Engine은 결함이 있는 TPU 슬라이스를 자동으로 감지하고 정상 하드웨어에서 다시 시작합니다. Google은 결함이 있는 하드웨어를 자동으로 감지하고 복구합니다. TPU 슬라이스 상태를 모니터링하고 비정상 슬라이스를 예약 시 확보한 정상 예비 하드웨어로 다시 예약하는 것은 사용자의 책임입니다.
유지보수 관리 Compute Engine은 유지보수 이벤트를 예약하고 관리합니다. 원하는 경우 예약된 유지보수 시간 전에 유지보수를 시작할 수 있습니다. 예약, 블록 또는 하위 블록 수준에서 유지보수를 예약하고 시작할 수 있는 세부적인 제어 기능이 있습니다.
지원되는 TPU 버전 모든 TPU 버전 TPU v6e (Trillium) 및 TPU7x (Ironwood)
지원되는 소비 옵션 모든 소비 옵션 최소 용량 크기가 1년 이상인 미래용 예약이 있어야 합니다. 캘린더 모드의 미래용 예약은 지원되지 않습니다. Google Cloud 계정팀에 문의하여 자세한 내용을 확인하고 모든 용량 모드 예약을 요청하세요.

관리형 용량 모드

기본적으로 TPU 용량은 관리형 용량 모드로 작동합니다. 이 모드에서 Compute Engine은 하드웨어 오류를 자동으로 감지하고 영향을 받는 TPU 인스턴스를 교체하여 워크로드가 정상 하드웨어에서 다시 시작될 수 있도록 합니다.

관리형 용량 모드에는 다음과 같은 기능이 있습니다.

  • 자동 인스턴스 복구: 주문형, Flex-start, 예약 소비 옵션의 경우 Compute Engine이 하드웨어 오류를 자동으로 감지하고 영향을 받는 TPU 인스턴스를 교체합니다.
  • 간소화된 관리: 호스트 유지보수 또는 복구 작업을 위해 수동으로 개입할 필요가 없습니다.

모든 용량 모드

모든 용량 모드는 TPU 리소스를 예약 기반으로 직접 제어할 수 있도록 설계되었습니다. 모든 용량 모드에서는 예약된 용량의 100% 에 액세스할 수 있습니다. 충분한 정상 예비 용량을 사용하여 TPU 슬라이스 복구를 관리하고 유지보수 이벤트를 예약할 책임은 사용자에게 있습니다.

모든 용량 모드에는 다음과 같은 기능이 있습니다.

  • 전체 용량 할당: 장애 복구 또는 워크로드 버스팅을 위해 할당된 예비 용량을 포함하여 예약된 모든 용량에 제한 없이 액세스합니다.
  • 토폴로지 인식 배치: 클러스터, 블록, 하위 블록, 호스트 토폴로지를 완전히 파악하여 워크로드 배치를 최적화합니다.
  • 고급 유지보수 제어: 예약, 블록 또는 하위 블록 수준에서 유지보수 이벤트를 예약하고 트리거합니다.
  • 보고 및 수리: 실적이 저조한 하드웨어를 수리하도록 보고합니다.

Google Cloud 계정팀에 문의하여 모든 용량 모드 예약을 요청하세요. 자세한 내용은 모든 용량 모드 개요를 참조하세요.

다음 단계