인공지능 (AI) 또는 머신러닝 (ML) 워크로드를 효율적으로 실행하려면 워크로드 조정자와 배포 플랫폼을 모두 선택해야 합니다. 이러한 구성요소는 다음과 같이 작동합니다.
조정자는 작업을 예약하고 실행합니다.
배포 옵션은 조정자를 관리합니다.
워크로드를 실행하는 데 사용할 GPU 인프라(클러스터링된 GPU 또는 일반 GPU)를 식별한 후 이 문서의 안내에 따라 워크로드 및 관리 수준에 가장 적합한 조정자와 배포를 식별합니다.
워크로드를 실행하는 데 사용할 수 있는 GPU 머신 유형을 검토하려면 GPU 머신을 참조하세요.
조정자 및 배포 옵션 비교
AI 하이퍼컴퓨터는 컴퓨팅 인스턴스를 위한 여러 조정자 및 배포 옵션을 제공합니다. 이러한 옵션은 워크로드에 집중할 수 있는 완전 관리형 클러스터부터 컴퓨팅 인스턴스를 유지보수하고 업데이트하는 방법을 세부적으로 제어할 수 있는 자체 관리형 환경까지 다양합니다.
다음 표에서는 AI 워크로드를 실행할 때 사용할 수 있는 조정자 및 배포 옵션을 비교합니다.
| 제품 | 조정자 | 기술적 복잡성 | 추천 대상 | 주요 이점 |
|---|---|---|---|---|
| Cluster Director | Slurm | 낮음 | AI 연구원, 데이터 과학자 | Slurm 클러스터의 관리형 수명 주기 |
| Google Kubernetes Engine (GKE) | Kubernetes | 중간~높음 | ML 엔지니어, 플랫폼 엔지니어 | 컨테이너 조정 및 확장 |
| Cluster Toolkit | Slurm, Kubernetes | 매체 | ML dZevOps, 플랫폼 엔지니어 | 검증된 코드형 인프라 청사진 |
| Compute Engine | 맞춤 / 없음 | 높음 | 인프라 설계자 | OS 및 네트워킹에 대한 세분화된 제어 |
조정자 및 배포 옵션 선택
조정자 및 배포 옵션을 선택하려면 다음 순서도를 사용하세요.
위의 순서도에서는 다음 질문을 합니다.
워크로드에 클러스터 조정이 필요하나요?
- 예: 질문 2로 이동합니다.
- 아니요: Compute Engine을 사용합니다.
표준 컨테이너화된 앱을 실행하시겠어요?
- 예: GKE를 사용합니다.
- 아니요: 질문 3으로 이동합니다.
Google에서 클러스터 수명 주기를 관리하도록 하시겠어요?
- 예: Cluster Director를 사용합니다.
- 아니요: Cluster Toolkit을 사용합니다.
지원되는 조정자
조정자는 클러스터 관리를 자동화하고 각 컴퓨팅 인스턴스를 개별적으로 관리할 필요가 없습니다. Slurm 또는 Kubernetes와 같은 조정자는 작업 대기열, 리소스 할당, 자동 확장을 처리합니다.
Slurm: AI, ML, HPC 워크로드에 흔히 사용되는 오픈소스 조정자입니다. Cluster Toolkit 또는 Cluster Director와 함께 Slurm을 사용할 수 있습니다.
Kubernetes: 오픈소스 컨테이너 조정 플랫폼입니다. GKE를 직접 사용하거나 Cluster Toolkit을 통해 Kubernetes를 배포할 수 있습니다.
맞춤 또는 없음: 다른 조정자를 선호하거나 조정자 없이 컴퓨팅 인스턴스를 관리하려면 Compute Engine을 사용합니다. 이 옵션은 가장 높은 수준의 제어를 제공하지만 컴퓨팅 인스턴스를 수동으로 설정, 유지보수, 업데이트해야 합니다.
지원되는 배포 플랫폼
사용 사례에 권장되는 조정자 및 배포 옵션을 식별한 후 아래 설명을 검토하여 관리 수준과 기능이 워크로드 요구사항을 충족하는지 확인합니다.
관리형 및 자동화된 플랫폼
클러스터 관리의 오버헤드를 방지하고 워크로드 실행에 집중하려면 다음 관리형 플랫폼 중 하나를 사용하세요.
Cluster Director: Slurm 클러스터의 수명 주기를 자동화하는 완전 관리형 서비스입니다. Cluster Director를 사용하여 Slurm 클러스터의 설정 및 구성을 간소화합니다. Cluster Director는 클러스터의 수명 주기를 자동화하므로 AI, ML, HPC 워크로드 실행에 집중할 수 있습니다. 자세한 내용은 Cluster Director 개요를 참조하세요.
GKE: AI 및 ML 워크로드에 최적화된 관리형 Kubernetes 환경입니다. GKE를 사용하여 컨테이너화된 워크로드를 조정하고, 특수 Compute Engine 하드웨어와 통합하고, 토폴로지 인식 일정 예약 (TAS)과 같은 GKE 전용 기능을 활용합니다. 자세한 내용은 GKE 개요를 참조하세요.
준관리형 및 자체 관리형 플랫폼
운영체제, 커널 구성 또는 드라이버 버전을 세부적으로 제어해야 하는 경우 준관리형 또는 자체 관리형 플랫폼을 사용하세요.
Cluster Toolkit: 재현 가능한 AI 및 ML 환경을 배포하기 위한 검증되고 맞춤설정 가능한 청사진을 제공하는 오픈소스 툴킷입니다. 코드형 인프라 (IaC) 원칙을 사용하여 높은 유연성과 제어 기능을 제공합니다. 자세한 내용은 Cluster Toolkit 개요를 참조하세요.
Compute Engine: 처음부터 맞춤 환경을 빌드하기 위한 최대한의 제어를 제공하는 맞춤설정 가능한 컴퓨팅 서비스입니다. Compute Engine은 독립형 조정자는 아니지만 자체 특수 맞춤 스택을 빌드하고 관리하려는 사용자를 위한 기반 역할을 합니다. 자세한 내용은 Compute Engine 개요를 참조하세요.
다음 단계
- 용량을 얻으려면 소비 옵션을 참조하세요.
- 클러스터를 배포하려면 클러스터 만들기 개요를 참조하세요.