AI 하이퍼컴퓨터 개요

AI 하이퍼컴퓨터는 인공지능 (AI) 및 머신러닝 (ML) 워크로드를 지원하도록 최적화된 통합 슈퍼컴퓨팅 시스템입니다. Google Cloud의 AI 인프라를 위한 통합 포트폴리오이며, 성능에 최적화된 하드웨어, 개방형 소프트웨어, 유연한 소비 모델을 살펴보고 구성하고 배포할 수 있는 단일 진입점을 제공합니다.

AI 하이퍼컴퓨터는 시스템 수준 설계와 우수사례를 통합하여 프로토타입 제작 및 개발에서 대규모 학습 및 실시간 서빙에 이르기까지 전체 AI 개발 수명 주기에서 효율성을 높입니다.

시스템 아키텍처

AI 하이퍼컴퓨터는 이러한 세 가지 구성요소를 수직으로 통합하여 실제 머신러닝 생산성을 측정하는 굿풋을 극대화합니다.

  • 성능 최적화 인프라: 가속기 (NVIDIA GPU 및 Google Cloud TPU), 네트워킹, 스토리지 리소스를 제공합니다.
    • GPU: 시스템에서 수명 주기 이벤트와 유지보수를 처리하는 방식에 따라 분류됩니다.
      • 일반 GPU: 비동기 유지보수가 있는 독립 컴퓨팅 단위로 관리되는 인프라입니다.
      • 클러스터링된 GPU: 동기화된 유지보수를 통해 긴밀하게 결합된 단일 시스템으로 관리되는 고성능 클러스터입니다.
    • TPU: 대규모 행렬 연산을 수행하도록 설계된 하드웨어를 사용하며 더 큰 모델과 배치 크기를 위한 온칩 고대역폭 메모리 (HBM)가 있습니다. TPU는 코드 변경 없이 워크로드를 확장하는 슬라이스라는 그룹으로 묶을 수 있습니다. TPU 인프라에 대한 자세한 내용은 Cloud TPU 문서를 참고하세요.
  • 오픈 소프트웨어: 머신러닝 프레임워크(PyTorch, JAX, TensorFlow) 및 오케스트레이션 플랫폼의 최적화된 버전을 제공합니다. 액셀러레이터를 배포하고 관리하려면 다음 옵션 중에서 선택하세요.
    • 자동화된 컨테이너 네이티브 확장용 Google Kubernetes Engine
    • Cluster Director를 통한 Slurm
    • Cluster Toolkit 청사진
  • 소비 옵션: 워크로드 요구사항에 따라 유연한 프로비저닝 옵션을 제공합니다.
    • Flex-start VM, 스팟 VM, 예약: 다양한 워크로드에 유연한 옵션을 제공합니다.
    • 동적 워크로드 스케줄러: 대규모 학습을 위해 상호 연결된 노드의 전체 블록에 대한 원자적 프로비저닝을 제공합니다.

이점

  • 고성능 및 굿풋: 굿풋을 최대화하도록 일정 및 런타임 레이어를 최적화하여 액셀러레이터가 생산적인 계산에 더 많은 시간을 소비하고 시스템 오버헤드에 더 적은 시간을 소비하도록 지원합니다.
  • 통합 안정성: 다음과 같은 전문 안정성 기능에 액세스할 수 있습니다.
    • 클러스터링된 GPU: 자동화된 하드웨어 상태 모니터링 및 사전 대응형 노드 교체가 포함됩니다.
    • 일반 GPU: 표준Google Cloud 노드 자동 복구를 사용하여 서빙 함대의 포드 수준 업타임을 유지합니다.
  • 스토리지 최적화: Google Cloud Managed Lustre 및 Cloud Storage Rapid와 같은 높은 처리량의 스토리지 서비스를 사용하여 I/O 병목 현상을 제거합니다.

사용 사례

AI 하이퍼컴퓨터는 다음 사용 사례의 요구사항을 충족합니다.

사용 사례 예제 작업 부하
대규모 AI 및 ML 워크로드
  • 생성형 AI를 위한 분산 학습
  • 생성형 AI 추론
  • 사기 행위 감지
  • 추천 모델
추론 및 모델 서빙
  • 실시간 사기 감지
  • 실시간 결과 추천 엔진
프로토타입 제작 및 개발
  • 소규모 실험
  • 초기 단계 개발

다음 단계