AI 하이퍼컴퓨터는 인공지능 (AI) 및 머신러닝 (ML) 워크로드를 지원하도록 최적화된 통합 슈퍼컴퓨팅 시스템입니다. Google Cloud의 AI 인프라를 위한 통합 포트폴리오이며, 성능에 최적화된 하드웨어, 개방형 소프트웨어, 유연한 소비 모델을 살펴보고 구성하고 배포할 수 있는 단일 진입점을 제공합니다.
AI 하이퍼컴퓨터는 시스템 수준 설계와 우수사례를 통합하여 프로토타입 제작 및 개발에서 대규모 학습 및 실시간 서빙에 이르기까지 전체 AI 개발 수명 주기에서 효율성을 높입니다.
시스템 아키텍처
AI 하이퍼컴퓨터는 이러한 세 가지 구성요소를 수직으로 통합하여 실제 머신러닝 생산성을 측정하는 굿풋을 극대화합니다.
- 성능 최적화 인프라: 가속기 (NVIDIA GPU 및 Google Cloud TPU), 네트워킹, 스토리지 리소스를 제공합니다.
- GPU: 시스템에서 수명 주기 이벤트와 유지보수를 처리하는 방식에 따라 분류됩니다.
- 일반 GPU: 비동기 유지보수가 있는 독립 컴퓨팅 단위로 관리되는 인프라입니다.
- 클러스터링된 GPU: 동기화된 유지보수를 통해 긴밀하게 결합된 단일 시스템으로 관리되는 고성능 클러스터입니다.
- TPU: 대규모 행렬 연산을 수행하도록 설계된 하드웨어를 사용하며 더 큰 모델과 배치 크기를 위한 온칩 고대역폭 메모리 (HBM)가 있습니다. TPU는 코드 변경 없이 워크로드를 확장하는 슬라이스라는 그룹으로 묶을 수 있습니다. TPU 인프라에 대한 자세한 내용은 Cloud TPU 문서를 참고하세요.
- GPU: 시스템에서 수명 주기 이벤트와 유지보수를 처리하는 방식에 따라 분류됩니다.
- 오픈 소프트웨어: 머신러닝 프레임워크(PyTorch, JAX, TensorFlow) 및 오케스트레이션 플랫폼의 최적화된 버전을 제공합니다. 액셀러레이터를 배포하고 관리하려면 다음 옵션 중에서 선택하세요.
- 자동화된 컨테이너 네이티브 확장용 Google Kubernetes Engine
- Cluster Director를 통한 Slurm
- Cluster Toolkit 청사진
- 소비 옵션: 워크로드 요구사항에 따라 유연한 프로비저닝 옵션을 제공합니다.
- Flex-start VM, 스팟 VM, 예약: 다양한 워크로드에 유연한 옵션을 제공합니다.
- 동적 워크로드 스케줄러: 대규모 학습을 위해 상호 연결된 노드의 전체 블록에 대한 원자적 프로비저닝을 제공합니다.
이점
- 고성능 및 굿풋: 굿풋을 최대화하도록 일정 및 런타임 레이어를 최적화하여 액셀러레이터가 생산적인 계산에 더 많은 시간을 소비하고 시스템 오버헤드에 더 적은 시간을 소비하도록 지원합니다.
- 통합 안정성: 다음과 같은 전문 안정성 기능에 액세스할 수 있습니다.
- 클러스터링된 GPU: 자동화된 하드웨어 상태 모니터링 및 사전 대응형 노드 교체가 포함됩니다.
- 일반 GPU: 표준Google Cloud 노드 자동 복구를 사용하여 서빙 함대의 포드 수준 업타임을 유지합니다.
- 스토리지 최적화: Google Cloud Managed Lustre 및 Cloud Storage Rapid와 같은 높은 처리량의 스토리지 서비스를 사용하여 I/O 병목 현상을 제거합니다.
사용 사례
AI 하이퍼컴퓨터는 다음 사용 사례의 요구사항을 충족합니다.
| 사용 사례 | 예제 작업 부하 |
|---|---|
| 대규모 AI 및 ML 워크로드 |
|
| 추론 및 모델 서빙 |
|
| 프로토타입 제작 및 개발 |
|