Gemini Enterprise Agent Platform 학습 클러스터는 다양한 워크로드를 수용하기 위해 다양한 머신 유형을 지원합니다. 클러스터 노드 풀을 구성할 때 다음 옵션 중에서 선택할 수 있습니다.
가속기 최적화 머신 유형
| 머신 유형 | GPU | 노드당 GPU |
|---|---|---|
a4x-highgpu-4g |
NVIDIA GB200 | 4 |
a4-highgpu-8g |
NVIDIA B200 | 8 |
a3-ultragpu-8g |
NVIDIA H200 | 8 |
a3-megagpu-8g |
NVIDIA H100 | 8 |
g4-standard-48 |
NVIDIA RTX PRO 6000 Blackwell | 1 |
g4-standard-96 |
NVIDIA RTX PRO 6000 Blackwell | 2 |
g4-standard-192 |
NVIDIA RTX PRO 6000 Blackwell | 4 |
g4-standard-384 |
NVIDIA RTX PRO 6000 Blackwell | 8 |
CPU 및 HPC 머신 유형
| 머신 유형 | 설명 |
|---|---|
N2 계열: n2-standard-*, n2-highmem-*, n2-highcpu-* |
가속기가 필요하지 않은 데이터 전처리, 작업 오케스트레이션, 기타 작업을 위한 범용 노드입니다. N2는 Slurm 로그인 노드에 사용되는 머신 계열이기도 합니다. |
H4D 계열: h4d-standard-*, h4d-highmem-* |
긴밀하게 결합된 시뮬레이션 및 전처리 워크로드를 위한 RDMA 네트워킹이 포함된 HPC 최적화 노드입니다. |
A4X 머신 유형
Gemini Enterprise Agent Platform 학습 클러스터는 A4X 가속기 최적화 머신 유형 (a4x-highgpu-4g)인 NVIDIA GB200 NVL72 랙 확장 아키텍처를 기반으로 하는 엑사스케일 플랫폼을 지원합니다.
아키텍처 비교
다음 표에서는 A4X 계열과 기타 가속기 최적화 계열 간의 기본적인 하드웨어 차이점을 간략하게 설명합니다.
| 기능 | A4X (a4x-highgpu-4g) | A3 / A4H |
|---|---|---|
| CPU 아키텍처 | ARM | X86 |
| GPU 수 | 노드당 GPU 4개 | 노드당 GPU 8개 |
| 등록 유형 | 모든 용량 모드 | 관리 모드 |
| 배치 정책 | 엄격 (좁게) | 유연성 |
A4X 관련 가이드라인
- A4X 노드 풀 VM 수는 18의 배수여야 합니다(예: 18, 36, 54). 이는 A4X 용량이 NVLink 도메인이라는 공유 불가능한 고정된 18개 노드 블록으로 프로비저닝되기 때문에 필요합니다. 이러한 도메인은 엄격한 압축 배치 정책에 의해 바인딩되며 부분적으로 할당된 블록은 다른 클러스터에서 사용할 수 없습니다.
- A4X 노드의 ARM 기반 아키텍처로 인해 학습 워크로드에 두 가지 주요 변경사항을 적용해야 합니다.
- ARM 호환 이미지 사용: 모든 학습 작업은 ARM 아키텍처용으로 빌드된 컨테이너 이미지를 사용해야 합니다.
- GPU 4개에 맞게 조정: 분산 학습 로직을 업데이트하여 각 A4X 노드에서 사용 가능한 GPU 4개를 올바르게 인식하고 사용해야 합니다.
- 호스트 오류 보고 프로세스 및 다운타임 호스트를 잘못된 것으로 신고할 때는 다음 복구 프로세스를 알고 있어야 합니다.
- 대기 용량 없음: 시스템은 즉시 노드 교체를 위해 대기 예비 풀을 사용하지 않습니다.
- 복구 기반 복구: 기본 물리적 호스트가 복구될 때까지 노드를 사용할 수 없습니다.
- 다운타임 연장: 이 복구 프로세스는 일반적으로 3~14일이 걸립니다.
용량 프로비저닝
적절한 프로비저닝 모델을 선택하는 것은 비용, 속도, 리소스 가용성의 균형을 맞추는 데 매우 중요합니다. 다음 프로비저닝 옵션을 참조하세요.
RESERVATION: 미리 생성한 특정 Compute Engine 예약에서 노드를 할당합니다. 이 모델은 용량을 보장하며 수요가 많은 리소스에 권장됩니다.FLEX_START: 동적 워크로드 스케줄러를 사용하여 작업을 대기열에 추가합니다. 요청된 컴퓨팅 리소스를 사용할 수 있게 되면 작업이 자동으로 시작되므로 예약 없이 유연한 시작 시간을 제공합니다.SPOT: 스팟 VM을 사용하여 노드 풀을 프로비저닝합니다. 이 옵션은 비용 효율성이 가장 높지만 VM이 언제든지 선점될 수 있으므로 내결함성을 갖추고 있고 중단을 처리할 수 있는 워크로드에만 사용해야 합니다.ON_DEMAND: CPU 전용 노드 풀의 기본 옵션이며 부족하지 않은 머신 유형에 가장 적합합니다. 예측 가능한 사용한 만큼만 지불하는 가격 책정으로 표준 VM 인스턴스를 제공합니다.
다음 안내에 따라 선택하세요.
수요가 많은 GPU 리소스(예: A3 및 A4)의 경우
RESERVATION모델을 적극 권장합니다. 이를 통해 중요한 학습 작업에 필요한 용량에 전용으로 액세스할 수 있습니다.버스트형 또는 유연한 워크로드:
FLEX_START또는SPOT을 고려하세요.FLEX_START는 리소스를 사용할 수 있을 때까지 작업을 대기열에 추가하는 반면SPOT은 선점을 처리할 수 있는 내결함성 작업에 상당한 비용 절감 효과를 제공합니다.머신 유형이 많은 경우:
ON_DEMAND모델이 적합합니다. 부족하지 않고 즉시 사용 가능 여부가 문제가 되지 않는 머신 유형에 사용합니다.
공유 예약 사용(선택사항)
로컬 예약이 아닌 공유 예약을 사용하려면 클러스터를 만들기 전에 추가 단계를 수행해야 합니다.
Gemini Enterprise Agent Platform 학습 클러스터에서 공유 예약을 사용하기 전에 공유 예약을 사용하는 VM을 수동으로 만들어 공유 예약이 작동하는지 확인하세요.
이 VM 생성이 작동하면 다음 단계로 이동합니다.
클러스터 생성 구성에서 다음 형식으로 예약 이름을 사용합니다.
projects/RESERVATION_HOST_PROJECT_ID/zones/RESERVATION_ZONE/reservations/RESERVATION_NAME
다음 단계
학습 클러스터의 컴퓨팅 및 프로비저닝 옵션을 선택한 후 클러스터를 만들고 클러스터에서 워크로드를 실행할 수 있습니다.
- Compute Engine 예약 만들기:
RESERVATION모델은 GPU와 같이 수요가 많은 리소스를 할당하는 데 사용됩니다. Compute Engine에서 새 예약을 만들어 필요한 리소스에 전용으로 액세스하는 방법을 알아봅니다. - 학습 클러스터 만들기: 단계별 가이드에 따라 Agent Platform API 또는
gcloud를 사용하여 첫 번째 영구 학습 클러스터를 만들어 학습한 구성을 적용합니다. - 학습 작업을 클러스터에 제출: 클러스터가 활성화되면 다음 단계는 워크로드를 실행하는 것입니다. 실행을 위해 영구 클러스터를 타겟팅하는
CustomJob을 제출합니다. - 분산 학습을 위한 코드 조정: 다중 노드 클러스터를 최대한 활용하려면 분산 환경에 맞게 학습 코드를 조정합니다.