AI 하이퍼컴퓨터 소비 옵션

AI 하이퍼컴퓨터에는 컴퓨팅 리소스를 획득하기 위한 여러 소비 옵션이 있습니다. 이러한 옵션은 워크로드 기간, 내결함성, 인프라 모델과 같은 요구사항을 해결합니다. 이러한 옵션에 대해 알아보고 사용 사례에 가장 적합한 옵션을 선택하세요.

수동 평가 대신Google Cloud 콘솔에서 Gemini에 프롬프트를 표시하여 워크로드 및 예산의 소비 옵션을 비교할 수 있습니다. 자세한 내용은 Compute Advisor로 AI 인프라 설계하기를 참고하세요.

소비 옵션 개요

주요 특성별로 소비 옵션을 비교하려면 다음 표를 사용하세요.

소비 옵션 프로비저닝 모델 용도 용량 보장 수명 선점형 할당량 할인 할당 모델
유연한 시작 유연한 시작 최대 7일 동안 용량을 기다릴 수 있는 단기 워크로드 최대한 노력 최대 7일 아니요 선점형 할당량 지원되는 시리즈에 최대 53% 할인 적용 MIG 크기 조절 요청의 경우 조밀합니다. 독립형 VM의 경우 최선을 다합니다.
스팟 VM 스팟 내결함성, 단기 일반 GPU 워크로드 최대한 노력 선점형 예 선점형 할당량 대폭 할인 (최대 91%) 표준
표준 예약 표준 용량에 대한 매우 높은 수준의 보장이 필요한 중요한 일반 GPU 워크로드 매우 높음 매우 높음 사용자 정의 아니요 사용된 할당량 없음 약정 사용 할인 (CUD)이 적용된 요금
용량 블록의 미래용 예약 예약에 따름 클러스터링된 GPU에서 대규모 장기 학습 매우 높음 예약 기간 내에는 무제한입니다. 아니요 할당량이 제공 전에 증가함 CUD로 최대 53% 할인 Dense
캘린더 모드의 미래용 예약 예약에 따름 예약된 용량이 필요한 클러스터링된 GPU 워크로드(최대 90일) 매우 높음 최대 90일 아니요 사용된 할당량 없음 할인 (최대 53%) Dense
주문형 VM 표준 특정 기간이 없는 일반 GPU 워크로드 최대한 노력 무제한 아니요 주문형 할당량 없음 (사용한 만큼만 지불) 표준

인프라를 배포하는 데 사용하는 소비 옵션은 일반 GPU를 사용하는지 아니면 클러스터형 GPU를 사용하는지에 따라 다릅니다.

  • 일반 GPU: 소규모 추론, 개발, 소규모 학습 워크로드를 위해 설계되었습니다. 이 유형의 GPU는 비동기 유지보수를 통해 운영 유연성을 제공합니다. 사용 가능한 옵션을 보려면 일반 GPU의 소비 옵션을 참고하세요.

  • 클러스터링된 GPU: 네트워크 지연 시간을 최소화하기 위해 높은 용량 보장과 밀도 높은 리소스 할당이 필요한 대규모의 긴밀하게 결합된 학습 워크로드와 대규모 추론, RL, 추론 모델 워크로드를 위해 설계되었습니다. 사용 가능한 옵션을 보려면 클러스터링된 GPU의 소비 옵션을 참고하세요.

일반 GPU의 사용 옵션

다음 소비 옵션을 사용하여 일반 GPU의 용량을 획득합니다.

flex-start 사용

집중적으로 할당된 리소스가 필요한 단기 워크로드를 실행하려면 Flex-start를 사용하여 최대 7일 동안 컴퓨팅 리소스를 요청하면 됩니다. 리소스를 사용할 수 있을 때마다 Compute Engine에서 요청된 수의 VM을 만듭니다. 독립형 Flex-start VM은 중지할 수 있지만 관리형 인스턴스 그룹 (MIG)이 크기 조절 요청을 통해 만드는 Flex-start VM은 중지할 수 없습니다. Flex-start VM은 사용자가 삭제할 때까지 또는 Compute Engine이 실행 기간이 종료될 때 VM을 삭제할 때까지 존재합니다.

이상적인 워크로드

  • 소규모 모델 사전 학습
  • 모델 미세 조정
  • 고성능 컴퓨팅(HPC) 시뮬레이션
  • 일괄 추론

주요 특징

  • 프로비저닝 모델: flex-start
  • 광범위한 하드웨어 지원: A4X Max 및 A4X를 제외한 클러스터링된 GPU 머신 유형을 요청합니다.
  • 지연 시간 최적화: 네트워크 지연 시간을 최소화하기 위해 독립형 VM에 압축 배치 정책을 적용합니다.
  • 비용 효율성: A4, A3, A2, G4 머신 시리즈의 vCPU, 메모리, GPU, 로컬 SSD 디스크에 최대 53% 할인이 적용됩니다. 지원되는 다른 시리즈에는 표준 주문형 요금이 적용됩니다. 자세한 내용은 flex-start 가격 책정을 참고하세요.

스팟 사용

내결함성 워크로드를 실행하려면 가용성에 따라 컴퓨팅 리소스를 즉시 확보하면 됩니다. 최저가로 리소스를 확보할 수 있습니다. 하지만 Compute Engine은 언제든지 VM을 선점하여 용량을 확보할 수 있습니다.

이상적인 워크로드

  • 일괄 처리 및 데이터 분석
  • 고성능 컴퓨팅 (HPC) 및 미디어 인코딩

주요 특징

  • 프로비저닝 모델: 스팟
  • 광범위한 하드웨어 지원: A4X Max 및 A4X를 제외한 클러스터링된 GPU 머신 유형을 요청합니다.
  • 지연 시간 최적화: 네트워크 지연 시간을 최소화하기 위해 독립형 VM에 압축 배치 정책을 적용합니다.
  • 비용 효율성: vCPU, 메모리, GPU, 로컬 SSD 디스크에 최대 91% 할인을 받으세요.

주문형 사용

도움말: 일반 GPU 용량을 확보할 가능성을 높이려면 Flex-start 또는 스팟을 사용하세요. 이러한 소비 옵션은 주문형 가격에 비해 할인된 가격으로 GPU를 제공하며 GPU와 같이 수요가 많은 리소스를 확보할 가능성을 높이도록 설계되었습니다.

특정 기간이 없는 워크로드를 실행하려면 가용성에 따라 컴퓨팅 리소스를 즉시 확보하면 됩니다. VM은 중지하거나 삭제할 때까지 실행됩니다.

이상적인 워크로드

  • 추론 및 모델 서빙
  • 프로토타입 제작 및 실험

주요 특징

  • 프로비저닝 모델: 표준
  • 즉시 사용 가능: 용량 예약이나 승인을 기다리지 않고 VM 인스턴스를 즉시 만듭니다.
  • 표준 가격: 장기 약정 없이 표준 주문형 요율로 리소스 비용을 지불합니다.
  • 다양한 하드웨어 지원: 일반 GPU 경로에서 지원되는 GPU 머신 시리즈와 함께 사용합니다.

표준 예약 사용

용량에 대한 매우 높은 수준의 보장이 필요한 중요한 일반 GPU 워크로드를 실행하려면 표준 예약을 사용하면 됩니다.

이상적인 워크로드

  • 중요한 프로덕션 워크로드
  • 보장된 용량이 필요한 워크로드

주요 특징

  • 프로비저닝 모델: 표준
  • 용량 보장: 리소스를 사용할 수 있다는 매우 높은 확신을 제공합니다.
  • 가격: 표준 요금이 적용되지만 CUD를 첨부하여 절감할 수 있습니다.

클러스터형 GPU의 소비 옵션

다음 소비 옵션을 사용하여 클러스터링된 GPU의 용량을 확보하세요.

용량 블록에 미래용 예약 사용

집중적으로 할당된 리소스가 필요한 장기 실행 대규모 분산 워크로드를 실행하려면 향후 날짜와 시간에 집중적으로 할당된 컴퓨팅 리소스를 요청하면 됩니다. 해당 기간 동안 예약된 리소스에 독점적으로 액세스할 수 있으며 리소스를 사용하여 VM 또는 클러스터를 만들 수 있습니다. 예약 기간이 끝나면 Compute Engine은 다음 작업을 수행합니다.

  • Compute Engine은 예약과 연결된 빈 스토리지 풀을 삭제합니다.
  • VM에 지정된 종료 작업에 따라 Compute Engine은 예약을 사용하는 모든 VM을 중지하거나 삭제합니다.

이상적인 워크로드

  • 파운데이션 모델 사전 학습
  • 여러 호스트에서 파운데이션 모델 추론

주요 특징

  • 프로비저닝 모델: 예약에 따름
  • 프리미엄 머신 지원: A4X Max, A4X, A4, A3 Ultra, A3 Mega 또는 A3 High (GPU 8개) 머신 유형을 예약합니다.
  • Hyperdisk 예약: 워크로드에 충분한 스토리지 리소스가 있는지 확인하기 위해 컴퓨팅 용량과 함께 Hyperdisk 스토리지 풀 또는 Hyperdisk Exapool을 예약할 수 있습니다. Google은 스토리지 성능을 최적화하기 위해 컴퓨팅 노드와 함께 Hyperdisk 풀을 배치합니다.
  • 약정 요구사항: 1년 이상 예약에 리소스 기반 약정을 연결하여 컴퓨팅 리소스 및 Hyperdisk 풀에 대한 할인을 받으세요.
  • 동적 수정: 기간이 시작된 후 Vertex AI 작업 사용에 대한 하드웨어 긴급 유지보수 알림을 사용 설정합니다.

캘린더 모드에서 미래용 예약 사용

집중적으로 할당된 리소스가 필요한 단기 분산 워크로드를 실행하려면 최대 90일 동안 컴퓨팅 리소스를 요청하면 됩니다. 이 기간 동안 예약된 리소스에 독점적으로 액세스할 수 있으며 리소스를 사용하여 VM 또는 클러스터를 만들 수 있습니다. 예약 기간이 끝나면 Compute Engine에서 다음을 수행합니다.

  • Compute Engine에서 예약을 삭제합니다.
  • VM에 지정된 종료 작업에 따라 Compute Engine은 예약을 사용하는 모든 VM을 중지하거나 삭제합니다.

이상적인 워크로드

  • 사전 학습 및 미세 조정
  • 대규모 시뮬레이션 및 추론

주요 특징

  • 프로비저닝 모델: 예약에 따름
  • 머신 시리즈 지원: A4, A3 Ultra, A3 Mega 또는 A3 High (GPU 8개) 머신 유형을 예약합니다.
  • 확장성 한도: 최대 90일 동안 최대 80개의 VM을 예약할 수 있습니다.
  • 프로비저닝 최적화: 예약에 따름 모델을 사용하여 GPU를 확보할 가능성을 높입니다.

flex-start 사용

최대 7일 동안 집약적으로 할당된 리소스가 필요한 경우 클러스터형 관리형 인스턴스 그룹 (MIG) 크기 조절 요청에 Flex-start를 사용합니다.

이상적인 워크로드

Flex-start VM은 다음과 같이 언제든지 시작할 수 있는 워크로드를 실행하는 데 적합합니다.

  • 소규모 모델 사전 학습
  • 모델 미세 조정
  • 고성능 컴퓨팅(HPC) 시뮬레이션
  • 일괄 추론

주요 특징

  • 프로비저닝 모델: flex-start
  • 리소스 할당: MIG 크기 조절 요청에 대해 밀도 있게 할당됩니다.
  • 비용 효율성: A4, A3, A2, G4 머신 시리즈의 vCPU, 메모리, GPU, 연결된 로컬 SSD 디스크에 최대 53% 할인이 적용됩니다. 지원되는 다른 머신 시리즈에는 표준 주문형 요금이 적용됩니다.

스팟 사용

Compute Engine에서 용량을 회수하기 위해 VM을 선점할 수 있다는 점을 고려하여 밀도 높게 할당된 내결함성 워크로드에 스팟 VM을 사용하여 큰 할인을 받을 수 있습니다.

이상적인 워크로드

  • 내결함성 분산 학습
  • 일괄 처리

주요 특징

  • 프로비저닝 모델: 스팟
  • 선점: Compute Engine은 언제든지 인스턴스를 선점할 수 있습니다.
  • 비용 효율성: vCPU, 메모리, GPU, 연결된 로컬 SSD 디스크에 최대 91% 할인 적용

다음 단계