이 문서에서는 AI 하이퍼컴퓨터에서 AI 워크로드용 클러스터를 만드는 방법을 요약합니다. 특히 이 문서에서는 클러스터를 시작할 때 따라야 하는 프로세스와 선택사항을 안내합니다. 수동 평가 대신 Google Cloud 콘솔에서 Gemini에 프롬프트를 표시하여 워크로드 및 예산의 소비 옵션을 비교할 수 있습니다. 자세한 내용은 Compute Advisor로 AI 인프라 설계를 참고하세요.
이 문서에서는 사용자가 모델 학습 및 추론과 같은 AI 및 ML 워크로드에 흔히 사용되는 용어에 익숙하다고 가정합니다. 또한 배포에 필요한 최적의 머신 유형과 용량을 결정해야 하는 특정 AI 워크로드(예: 파운데이션 모델 사전 학습, 세부 조정 또는 추론)를 식별했다고 가정합니다.
클러스터 시작
클러스터 시작에는 다음 단계가 포함됩니다.
워크로드를 확인하고 머신 유형 선택
AI 워크로드의 머신 유형을 선택합니다. AI 하이퍼컴퓨터는 클러스터링된 GPU와 일반 GPU 모두에 대한 클러스터 생성을 지원합니다.
선택에 도움이 되도록 워크로드 요구사항을 파악하고 권장되는 머신 유형 및 GPU 유형과 일치시킵니다.
- 클러스터링된 GPU: 파운데이션 모델 사전 학습, 대규모 모델 미세 조정, 여러 호스트 간 추론과 같은 대규모 고성능 워크로드에 가장 적합합니다.
- 일반 GPU: 주류 추론 및 서빙, 검색 증강 생성 (RAG), 비용 효율적인 중소 규모 모델 학습 및 미세 조정에 가장 적합합니다.
워크로드를 권장 머신 유형과 일치시키려면 다음 표를 사용하세요.
| GPU 유형 | 워크로드 또는 사용 사례 | 권장 머신 유형 |
|---|---|---|
| 클러스터링된 GPU | 여러 호스트에서 파운데이션 모델 사전 학습 및 추론 | A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)* |
| 대규모 모델 학습, 미세 조정, 추론 | A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB) | |
| 주류 모델 추론 및 미세 조정 | A3 Mega (NVIDIA H100 80GB), A3 High (NVIDIA H100 80GB) | |
| 일반 GPU | 높은 처리량의 에지 서빙 및 추론 | A3 Edge (NVIDIA H100 80GB) |
| 고성능 단일 노드 서빙 및 소규모 미세 조정 | A2 (NVIDIA A100) | |
| 비용에 최적화된 엔트리 레벨 추론 | G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 또는 V100) | |
| 주류 추론, RAG, 소규모~중규모 모델 학습 | G2 (NVIDIA L4) |
각 머신 시리즈에 대한 자세한 내용은 GPU 가속기 정보를 참고하세요.
소비 옵션 선택 및 용량 확보
선택한 머신 유형과 일반 GPU 또는 클러스터링된 GPU 사용 여부에 따라 GPU 리소스의 소비 옵션을 선택합니다.
일반 GPU의 사용 옵션
| 소비 옵션 | 적용 대상 | 용도 | 요청 방법 |
|---|---|---|---|
| 주문형 | 모든 일반 GPU | 보장된 용량이 필요하지 않은 워크로드 | 컴퓨팅 인스턴스 또는 클러스터를 만들고 표준 프로비저닝 모델을 지정합니다. 자세한 내용은 VM 인스턴스 만들기를 참고하세요. 도움말: 일반 GPU 용량을 확보할 가능성을 높이려면 Flex-start 또는 스팟을 사용하세요. |
| 표준 예약 및 표준 미래용 예약 | 모든 일반 GPU | 즉시 (표준 예약) 또는 특정 미래 날짜 (표준 미래용 예약)에 보장된 용량이 필요한 워크로드 | 온디맨드 예약 또는 미래용 예약 요청을 만듭니다. 자세한 내용은 용량 예약을 참고하세요. |
| 유연한 시작 | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 최대 7일 동안 지속되는 단기 고밀도 클러스터가 필요한 워크로드 밀도 높은 리소스 할당과 지원되는 머신 유형에 최대 53% 할인을 제공합니다. 그렇지 않으면 표준 주문형 요금이 적용됩니다. | Compute Engine, Cluster Director, Cluster Toolkit 또는 GKE를 사용하여 요청을 만듭니다. 리소스는 사용 가능해지는 즉시 프로비저닝됩니다 (시작 시간이 즉시가 아님). 자세한 내용은 용량 확보를 참고하세요. |
| 스팟 | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 내결함성, 일괄 처리 또는 단기 워크로드 가장 큰 할인 (61~90%)을 제공하지만 컴퓨팅 리소스가 언제든지 선점될 수 있습니다. | 스팟 프로비저닝 모델을 사용하여 인스턴스 또는 노드 풀을 즉시 만듭니다. 자세한 내용은 용량 확보를 참고하세요. |
클러스터형 GPU의 사용 옵션
| 소비 옵션 | 적용 대상 | 용도 | 요청 방법 |
|---|---|---|---|
| 용량 블록의 미래용 예약 | 모든 클러스터링된 GPU 및 A3 Edge 머신 유형 | 여러 호스트에서 파운데이션 모델을 사전 학습하거나 파운데이션 모델을 추론하는 등 장기간 안정성이 요구되는 워크로드 이 예약 방법을 사용하면 리소스를 집약적으로 할당하고 선택적 Hyperdisk 풀을 사용할 수 있으며, 365일 이상 리소스를 예약하는 경우 vCPU, 메모리, GPU, 로컬 SSD 디스크, Hyperdisk 풀에 대한 할인을 받을 수 있습니다. | Google 계정팀을 통해 미래의 날짜와 시간에 90일 이상의 기간 동안 사용할 리소스를 요청합니다. |
| 캘린더 모드의 미래용 예약 | A4X Max 및 A4X를 제외한 모든 클러스터링된 GPU | 최대 90일 동안 실행되고 안정성이 필요한 워크로드(예: 모델 사전 학습 또는 미세 조정) 집중적인 리소스 할당과 최대 53% 할인을 제공합니다. | 미래의 날짜 및 시간에 대한 셀프 서비스 예약 요청을 만듭니다. Google Cloud 가 요청을 승인해야 합니다. 자세한 내용은 용량 예약을 참고하세요. |
| 유연한 시작 | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 최대 7일 동안 지속되는 단기 고밀도 클러스터가 필요한 워크로드 밀도 높은 리소스 할당과 지원되는 머신 유형에 최대 53% 할인을 제공합니다. 그 외에는 표준 주문형 요금이 적용됩니다. | Compute Engine, Cluster Director, Cluster Toolkit 또는 GKE를 사용하여 요청을 만듭니다. 리소스는 사용 가능해지는 즉시 프로비저닝됩니다 (시작 시간이 즉시가 아님). 자세한 내용은 용량 확보를 참고하세요. |
| 스팟 | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 내결함성, 일괄 처리 또는 단기 워크로드 가장 큰 할인 (61~90%)을 제공하지만 언제든지 컴퓨팅 리소스가 선점될 수 있습니다. | 스팟 프로비저닝 모델을 사용하여 인스턴스 또는 노드 풀을 즉시 만듭니다. 자세한 내용은 용량 확보를 참고하세요. |
배포 옵션 선택
클러스터 배포에 필요한 제어 수준에 따라 다음 옵션 중에서 선택합니다.
- 고도로 관리되는 배포: 관리형 서비스는 컴퓨팅, 네트워킹, 스토리지 리소스의 설정, 조정, 구성을 자동화합니다.
- 관리형 감소, 제어 기능 강화 배포: VM, 맞춤 환경, 오케스트레이션 레이어를 수동으로 만들고 관리합니다.
고도로 관리됨
고도로 관리되는 배포 옵션은 컴퓨팅, 네트워킹, 스토리지 리소스의 설정 및 조정을 자동화하여 클러스터 관리의 운영 오버헤드를 줄입니다. 인프라를 배포하고 구성하려면 Cluster Director, Cluster Toolkit 또는 GKE를 사용하세요.
Cluster Director: 클러스터의 복잡한 설정과 구성을 자동화하여 클러스터의 컴퓨팅, 네트워킹, 스토리지 리소스를 구성하여 성능을 극대화하고 다운타임을 최소화할 수 있도록 지원하는Google Cloud 제품입니다. Cluster Director는 클러스터 관리 오버헤드를 방지하고 대신 워크로드 실행에 집중하려는 IT 관리자와 AI 연구자를 위해 설계되었습니다.
Cluster Toolkit: GKE 또는 Compute Engine의 클러스터 구성 및 배포를 간소화하는 Google 제공 오픈소스 도구입니다. 사전 정의된 청사진을 사용하여 Slurm이 포함된 A4 머신 유형과 같은 일반적인 구성을 배포합니다. 청사진을 수정하여 배포 및 소프트웨어 스택을 맞춤설정할 수 있습니다.
GKE: 관리형 Kubernetes 서비스이자 오픈소스 컨테이너 조정 플랫폼입니다. GKE는 자동 확장 및 고가용성과 같은 기능을 제공합니다. 또한 컨테이너화된 애플리케이션을 오케스트레이션하고, 특수 하드웨어를 지원하며, Google Cloud생태계와 호환되므로 AI 또는 ML 워크로드를 배포하고 관리하는 데 적합합니다. GKE를 직접 사용하거나 Cluster Toolkit을 사용하여 GKE 클러스터를 배포할 수 있습니다.
관리형 감소, 제어 기능 강화
클러스터와 클러스터에 설치된 소프트웨어를 더 세부적으로 제어하려면 관리형 Compute Engine 인스턴스 그룹 (MIG)을 사용하거나 인스턴스를 일괄적으로 만들어 Compute Engine 클러스터를 만드세요. 그런 다음 인스턴스에 필요한 주요 소프트웨어를 수동으로 설치합니다.
조정자 선택
조정자는 클러스터 관리를 자동화합니다. 조정자를 사용하면 클러스터의 각 컴퓨팅 인스턴스를 관리할 필요가 없습니다. Slurm 또는 GKE와 같은 조정자는 작업 대기열, 리소스 할당, 자동 확장 (GKE의 경우) 및 기타 일상적인 클러스터 관리 작업과 같은 작업을 처리합니다.
Slurm: Slurm은 HPC, AI 또는 ML 워크로드에 일반적으로 사용되는 오픈소스 오케스트레이터입니다. 관리형 Slurm 환경의 경우 Cluster Director를 사용할 수 있습니다. Slurm을 기본적으로 사용하려면 클러스터에 Slurm을 자동으로 설치하는 클러스터 청사진을 제공하는 Cluster Toolkit을 사용하거나 Compute Engine 클러스터에 Slurm을 수동으로 설치하면 됩니다.
GKE: GKE는 오픈소스 컨테이너 조정 플랫폼인 Kubernetes를 기반으로 구축된 관리형 서비스입니다. GKE는 컨테이너화된 애플리케이션을 오케스트레이션하고, 특수 하드웨어를 지원하며, Google Cloud생태계에 속해 있기 때문에 AI 또는 ML 워크로드를 배포하고 관리하는 데 적합합니다. GKE를 직접 사용하거나 Cluster Toolkit을 사용하여 GKE 클러스터를 배포할 수 있습니다.
자체 오케스트레이터 사용: 다른 오케스트레이터를 사용하려면 Compute Engine 클러스터를 사용하세요. Compute Engine 클러스터를 만드는 것은 Google Cloud에서 제공하는 옵션 중 가장 관리가 적은 옵션입니다. 이 옵션을 선택하면 인스턴스를 설정, 유지관리, 업데이트하는 책임이 사용자에게 있습니다.
운영체제 이미지 선택
사용해야 하는 이미지는 사용하는 GPU 인프라(클러스터링된 GPU 또는 일반 GPU)와 클러스터를 배포하는 방법 (GKE, Slurm 또는 Compute Engine)에 따라 다릅니다. GKE 클러스터의 경우 Container-Optimized OS를 사용합니다. Compute Engine 및 Slurm 클러스터의 경우 GPU와 같은 가속기에 최적화된 시스템 이미지를 선택합니다. 또한 워크로드에 딥 러닝 소프트웨어 계층 (DLSL) 컨테이너 이미지를 선택할 수 있습니다.
자세한 내용은 AI 하이퍼컴퓨터 이미지를 참고하세요.
GKE 클러스터용 이미지
GKE 클러스터를 만들려면 Standard 모드와 Autopilot 모드 모두에 기본 컨테이너 OS 이미지를 사용하세요. 하지만 일반 모드에서는 Ubuntu와 같은 다른 사용 가능한 이미지를 선택할 수도 있습니다.
Cluster Toolkit을 사용하여 클러스터를 배포하는 경우 컨테이너 OS 이미지만 사용할 수 있습니다. 이러한 이미지는 클러스터 청사진에 내장되어 있기 때문입니다. 각 노드 이미지에 대한 자세한 내용은 GKE 문서의 노드 이미지를 참고하세요.
GKE는 NVIDIA CUDA 및 NCCL과 같은 패키지와 ML 프레임워크(예: PyTorch)를 설치하여 딥 러닝 워크로드에 바로 사용할 수 있는 환경을 제공하는 딥 러닝 소프트웨어 계층(DLSL) 컨테이너 이미지도 제공합니다. 이러한 사전 빌드된 DLSL 컨테이너 이미지는 GKE 클러스터에서 원활하게 작동하는 것으로 테스트되고 검증되었습니다.
Compute Engine 클러스터용 OS 이미지
AI 하이퍼컴퓨터는 Compute Engine을 사용하여 AI 및 ML 워크로드를 실행하는 데 최적화된 이미지를 제공합니다. 가장 익숙한 OS를 선택하세요.
- Rocky Linux 9 액셀러레이터
- Rocky Linux 8 액셀러레이터
- Ubuntu 24.04 LTS 액셀러레이터
- Ubuntu 22.04 LTS 액셀러레이터
클러스터 툴킷을 사용하는 경우 클러스터 툴킷이 Ubuntu LTS 액셀러레이터 OS 이미지를 확장하는 맞춤 이미지를 만들기 때문에 이러한 액셀러레이터 이미지가 이미 클러스터 툴킷 청사진에 번들로 제공됩니다.
각 OS 이미지에 대한 자세한 내용은 Compute Engine 문서의 운영체제 세부정보를 참고하세요.
클러스터 만들기
클러스터 생성 프로세스를 검토하고 워크로드에 대한 예비 결정을 내린 후 다음 옵션 중 하나를 사용하여 클러스터를 만듭니다.
- GKE 클러스터를 만듭니다.
- Slurm 클러스터를 만듭니다.
- VM 인스턴스 만들기 (단일, 일괄 또는 MIG)
워크로드용 스토리지 프로비저닝
성능, 비용, 스토리지 아키텍처 요구사항에 따라 프로비저닝할 스토리지 서비스를 선택합니다.