용어

다음 약관은 AI 하이퍼컴퓨터에 적용됩니다.

액셀러레이터
일반 목적 프로세서보다 머신러닝 워크로드와 같은 특정 작업을 더 효율적으로 실행하도록 설계된 특수 하드웨어 기기(예: GPU 또는 TPU)입니다.

블록
상호 연결된 하위 블록의 모음입니다. 블록 내에서 모든 GPU는 네트워크 패브릭을 통해 연결할 수 있으므로 분산 학습 작업에 매우 짧은 지연 시간의 통신이 보장됩니다.

클러스터
고속 패브릭으로 연결된 상호 연결된 블록의 모음입니다. 비차단 동서 네트워크 패브릭을 사용하면 성능 또는 대역폭 병목 현상 없이 수천 개의 GPU에서 대규모 학습 작업을 확장할 수 있습니다.

클러스터링된 GPU
A4X, A4, A3 Ultra, A3 Mega, A3 High (GPU 8개)를 비롯한 GPU용 머신 계열 카테고리입니다. 클러스터링된 GPU를 사용하면 팀에서 특수 네트워킹 패브릭과 동기화된 유지보수를 사용하여 수천 개의 상호 연결된 액셀러레이터를 단일의 긴밀하게 결합된 시스템으로 배포하고 확장할 수 있습니다. 이러한 GPU는 극도의 컴퓨팅, 메모리, 고속 네트워킹 동기화가 필요한 워크로드에 적합합니다. 일반적인 사용 사례로는 수조 개의 매개변수가 있는 파운데이션 모델 사전 학습, 프런티어 모델 서빙, 신약 개발 시뮬레이션이 있습니다.

긴급 유지보수
비상 유지보수 라고도 합니다. 심각한 하드웨어, 소프트웨어 또는 보안 문제로 인해 발생하는 계획되지 않은 유지보수 이벤트입니다. 지원되는 액셀러레이터 머신 유형의 경우 긴급 유지보수는 즉각적인 중단 대신 사전 알림을 제공합니다. 이 알림을 통해 시스템에서 VM을 종료하기 전에 워크로드를 정상적으로 드레인하고 필요에 따라 복구를 트리거할 수 있습니다.

일반 GPU
G2, G4, A2, N1+T4, A3 Edge를 비롯한 GPU 머신 계열 카테고리입니다. 일반 GPU를 사용하면 팀에서 조정된 슈퍼컴퓨팅 클러스터의 아키텍처 복잡성을 우회하여 완전한 운영 자율성을 갖춘 NVIDIA 액셀러레이터를 배포하고 확장할 수 있습니다. 이러한 GPU는 고가용성, 셀프서비스 프로비저닝, 독립적인 확장을 우선시하는 워크로드에 적합합니다. 일반적인 사용 사례로는 실시간 추론, RAG, 프로토타입 제작, 중소 규모 모델 학습이 있습니다.

네트워크 패브릭
네트워크 패브릭은 클러스터의 모든 블록과 서비스에 걸쳐 지연 시간이 짧은 고대역폭 연결을 제공합니다. Google Cloud Jupiter는 소프트웨어 정의 네트워킹과 광 회로 스위치를 사용하여 네트워크를 발전시키고 성능을 최적화하는 Google의 데이터 센터 네트워크 아키텍처입니다.

노드 또는 호스트
데이터 센터의 단일 실제 서버 머신입니다. 각 호스트에는 액셀러레이터와 같은 연결된 컴퓨팅 리소스가 있습니다. 이러한 컴퓨팅 리소스의 수와 구성은 머신 계열에 따라 다릅니다. Compute Engine 인스턴스는 실제 호스트 위에 프로비저닝됩니다.

하위 블록이라고도 하는 NVLink 도메인은 A4X Max 및 A4X 머신의 핵심 용량 단위입니다. NVLink 도메인은 다중 노드 NVLink 시스템으로 연결된 18개의 A4X Max 또는 A4X 인스턴스 (GPU 72개)로 구성됩니다.

하위 블록
단일 실제 랙에 있는 호스트 그룹과 연결된 연결 하드웨어입니다. A4X Max 및 A4X 머신의 컨텍스트에서 하위 블록은 NVLink 도메인이라고도 합니다.

슈퍼블록
데이터 센터 내에서 상호 연결된 머신의 물리적 그룹화입니다. 머신을 슈퍼블록 내에 배치하면 긴밀하게 결합된 학습 워크로드를 실행하는 데 필요한 극도의 네트워크 처리량과 1밀리초 미만의 지연 시간을 달성할 수 있습니다.

추가 정보

다음 문서에서는 관련 주제와 관련된 용어를 자세히 설명합니다.