AI 하이퍼컴퓨터 소비 옵션

AI 하이퍼컴퓨터에는 컴퓨팅 리소스를 확보하기 위한 여러 소비 옵션이 있습니다. 이러한 옵션은 워크로드 기간, 내결함성, 인프라 모델과 같은 요구사항을 해결합니다. 이러한 옵션에 대해 알아보고 사용 사례에 가장 적합한 옵션을 선택하세요.

소비 옵션 개요

주요 특성 전반에서 소비 옵션을 비교하려면 다음 표를 사용하세요.

소비 옵션 프로비저닝 모델 용도 용량 보장 수명 선점형 Quota 할인 할당 모델
Flex-start Flex-start 용량을 기다릴 수 있는 최대 7일의 단기 워크로드 최대한 노력 최대 7일 아니요 선점형 할당량 지원되는 시리즈에 최대 53% 할인 MIG 크기 조절 요청의 경우 Dense, 독립형 VM의 경우 최대한 노력
스팟 VM 스팟 내결함성 단기 일반 GPU 워크로드 최대한 노력 선점형 선점형 할당량 대폭 할인 (최대 91%) 표준
표준 예약 표준 용량에 대한 매우 높은 수준의 보장이 필요한 중요한 일반 GPU 워크로드 매우 높음 매우 높음 사용자 정의 아니요 할당량 사용 안 함 약정 사용 할인 (CUD)이 적용된 할인 요금
용량 블록의 미래용 예약 예약에 따름 클러스터링된 GPU에서 대규모 장기 실행 학습 매우 높음 예약 기간 내 무제한 아니요 자동 증가 CUD로 최대 53% 할인 Dense
캘린더 모드의 미래용 예약 예약에 따름 예약된 용량이 필요한 최대 90일의 클러스터링된 GPU 워크로드 매우 높음 최대 90일 아니요 할당량 사용 안 함 최대 53% 할인 Dense
주문형 VM 표준 특정 기간이 없는 일반 GPU 워크로드 최대한 노력 무제한 아니요 주문형 할당량 없음 (사용한 만큼만 지불) 표준

인프라를 배포하는 데 사용하는 소비 옵션은 일반 GPU를 사용하는지 클러스터링된 GPU를 사용하는지에 따라 다릅니다.

  • 일반 GPU: 소규모 추론, 개발, 소규모 학습 워크로드용으로 설계되었습니다. 이 유형의 GPU는 비동기 유지보수를 통해 운영 유연성을 제공합니다. 사용 가능한 옵션을 보려면 일반 GPU의 소비 옵션을 참고하세요.

  • 클러스터링된 GPU: 대규모의 긴밀하게 결합된 학습 워크로드와 높은 용량 보장 및 네트워크 지연 시간을 최소화하기 위한 Dense 리소스 할당이 필요한 대규모 추론, RL, 추론 모델 워크로드용으로 설계되었습니다. 사용 가능한 옵션을 보려면 클러스터링된 GPU의 소비 옵션을 참고하세요.

일반 GPU의 소비 옵션

다음 소비 옵션을 사용하여 일반 GPU의 용량을 확보하세요.

Flex-start 사용

집중적으로 할당된 리소스가 필요한 단기 워크로드를 실행하려면 Flex-start를 사용하여 최대 7일 동안 컴퓨팅 리소스를 요청할 수 있습니다. 리소스가 사용 가능할 때마다 Compute Engine은 요청된 VM 수를 만듭니다. 독립형 Flex-start VM은 중지할 수 있지만 관리형 인스턴스 그룹 (MIG)이 크기 조절 요청을 통해 만드는 Flex-start VM은 중지할 수 없습니다. Flex-start VM은 사용자가 삭제하거나 Compute Engine이 실행 기간이 끝날 때 VM을 삭제할 때까지 존재합니다.

이상적인 워크로드

  • 소규모 모델 사전 학습
  • 모델 미세 조정
  • 고성능 컴퓨팅(HPC) 시뮬레이션
  • 일괄 추론

주요 특징

  • 프로비저닝 모델: Flex-start.
  • 광범위한 하드웨어 지원: A4X Max 및 A4X를 제외한 모든 클러스터링된 GPU 머신 유형을 요청합니다.
  • 지연 시간 최적화: 독립형 VM에 압축 배치 정책을 적용하여 네트워크 지연 시간을 최소화합니다.
  • 비용 효율성: A4, A3, A2, G4 머신 시리즈의 vCPU, 메모리, GPU, 로컬 SSD 디스크에 최대 53% 할인을 받습니다. 표준 주문형 요금은 다른 지원되는 시리즈에 적용됩니다. 자세한 내용은 Flex-start 가격 책정을 참고하세요.

스팟 사용

내결함성 워크로드를 실행하려면 가용성을 기준으로 컴퓨팅 리소스를 즉시 확보할 수 있습니다. 가능한 최저가로 리소스를 확보할 수 있습니다. 그러나 Compute Engine은 언제든지 VM을 선점하여 용량을 회수할 수 있습니다.

이상적인 워크로드

  • 일괄 처리 및 데이터 분석
  • 고성능 컴퓨팅 (HPC) 및 미디어 인코딩

주요 특징

  • 프로비저닝 모델: 스팟
  • 광범위한 하드웨어 지원: A4X Max 및 A4X를 제외한 모든 클러스터링된 GPU 머신 유형을 요청합니다.
  • 지연 시간 최적화: 독립형 VM에 압축 배치 정책을 적용하여 네트워크 지연 시간을 최소화합니다.
  • 비용 효율성: vCPU, 메모리, GPU, 로컬 SSD 디스크에 최대 91% 할인을 받습니다.

주문형 사용

도움말: 일반 GPU 용량을 확보할 가능성을 높이려면 Flex-start 또는 스팟을 사용하세요. 이러한 소비 옵션은 주문형 가격 책정과 비교하여 할인된 가격으로 GPU를 제공하며 GPU와 같이 수요가 많은 리소스를 확보할 가능성을 높이는 데 도움이 되도록 설계되었습니다.

특정 기간이 없는 워크로드를 실행하려면 가용성을 기준으로 컴퓨팅 리소스를 즉시 확보할 수 있습니다. VM은 사용자가 중지하거나 삭제할 때까지 실행됩니다.

이상적인 워크로드

  • 추론 및 모델 서빙
  • 프로토타입 제작 및 실험

주요 특징

  • 프로비저닝 모델: 표준
  • 즉시 사용 가능: 용량 예약 또는 승인을 기다리지 않고 VM 인스턴스를 즉시 만듭니다.
  • 표준 가격 책정: 장기 약정 없이 표준 주문형 요금으로 리소스 비용을 지불합니다.
  • 광범위한 하드웨어 지원: 일반 GPU 경로에서 지원되는 모든 GPU 머신 시리즈와 함께 사용합니다.

표준 예약 사용

용량에 대한 매우 높은 수준의 보장이 필요한 중요한 일반 GPU 워크로드를 실행하려면 표준 예약을 사용하면 됩니다.

이상적인 워크로드

  • 중요한 프로덕션 워크로드
  • 보장된 용량이 필요한 워크로드

주요 특징

  • 프로비저닝 모델: 표준
  • 용량 보장: 리소스가 사용 가능함을 매우 높은 수준으로 보장합니다.
  • 가격 책정: 표준 요금이 적용되지만 CUD를 연결하여 비용을 절감할 수 있습니다.

클러스터링된 GPU의 소비 옵션

다음 소비 옵션을 사용하여 클러스터링된 GPU의 용량을 확보하세요.

용량 블록의 미래용 예약 사용

집중적으로 할당된 리소스가 필요한 장기 실행 대규모 분산 워크로드를 실행하려면, 특정 미래 시간에 컴퓨팅 리소스를 요청할 수 있습니다. 해당 기간 동안 예약된 리소스에 독점적으로 액세스할 수 있으며 리소스를 사용하여 VM 또는 클러스터를 만들 수 있습니다. 예약 기간이 끝나면 Compute Engine에서 다음을 수행합니다.

  • Compute Engine에서 예약을 삭제합니다.
  • VM에 지정한 종료 작업 을 기반으로 Compute Engine은 예약을 사용하는 모든 VM을 중지하거나 삭제합니다.

이상적인 워크로드

  • 파운데이션 모델 사전 학습
  • 여러 호스트에서 파운데이션 모델 추론

주요 특징

  • 프로비저닝 모델: 예약에 따름
  • 프리미엄 머신 지원: A4X Max, A4X, A4, A3 Ultra, A3 Mega 또는 A3 High (GPU 8개) 머신 유형을 예약합니다.
  • 약정 요구사항: 1년 이상의 예약에 리소스 기반 약정을 연결합니다.
  • 동적 수정: 하드웨어 비상 유지보수 알림을 사용 설정합니다. 기간이 시작된 후 Vertex AI 작업 사용에 대해

캘린더 모드의 미래용 예약 사용

집중적으로 할당된 리소스가 필요한 단기 분산 워크로드를 실행하려면 최대 90일 동안 컴퓨팅 리소스를 요청할 수 있습니다. 해당 기간 동안 예약된 리소스에 독점적으로 액세스할 수 있으며 리소스를 사용하여 VM 또는 클러스터를 만들 수 있습니다. 예약 기간이 끝나면 Compute Engine에서 다음을 수행합니다.

  • Compute Engine에서 예약을 삭제합니다.
  • VM에 지정한 종료 작업 을 기반으로 Compute Engine은 예약을 사용하는 모든 VM을 중지하거나 삭제합니다.

이상적인 워크로드

  • 사전 학습 및 미세 조정
  • 대규모 시뮬레이션 및 추론

주요 특징

  • 프로비저닝 모델: 예약에 따름
  • 머신 시리즈 지원: A4, A3 Ultra, A3 Mega 또는 A3 High (GPU 8개) 머신 유형을 예약합니다.
  • 확장성 한도: 최대 90일 동안 최대 80개의 VM을 예약합니다.
  • 최적화된 프로비저닝: 예약에 따름 모델을 사용하여 GPU를 확보할 가능성을 높입니다.

Flex-start 사용

최대 7일 동안 집중적으로 할당된 리소스가 필요한 경우 클러스터링된 관리형 인스턴스 그룹 (MIG) 크기 조절 요청에 Flex-start를 사용합니다.

이상적인 워크로드

Flex-start VM은 다음과 같이 언제든지 시작할 수 있는 워크로드를 실행하는 데 적합합니다.

  • 소규모 모델 사전 학습
  • 모델 미세 조정
  • 고성능 컴퓨팅(HPC) 시뮬레이션
  • 일괄 추론

주요 특징

  • 프로비저닝 모델: Flex-start.
  • 리소스 할당: MIG 크기 조절 요청에 집중적으로 할당됩니다.
  • 비용 효율성: A4, A3, A2, G4 머신 시리즈의 vCPU, 메모리, GPU 및 연결된 로컬 SSD 디스크에 최대 53% 할인을 받습니다. 표준 주문형 요금은 다른 지원되는 시리즈에 적용됩니다.

스팟 사용

Compute Engine이 용량을 회수하기 위해 VM을 선점할 수 있다는 점을 이해하고 집중적으로 할당된 내결함성 워크로드에 스팟 VM을 사용하여 대폭 할인을 받을 수 있습니다.

이상적인 워크로드

  • 내결함성 분산 학습
  • 일괄 처리

주요 특징

  • 프로비저닝 모델: 스팟
  • 선점: Compute Engine은 언제든지 인스턴스를 선점할 수 있습니다.
  • 비용 효율성: vCPU, 메모리, GPU, 연결된 로컬 SSD 디스크에 최대 91% 할인을 받습니다.

다음 단계