그래픽 처리 장치 (GPU)는 대규모 병렬 워크로드를 동시에 처리하도록 설계된 특수 하드웨어 가속기입니다.Google Cloud에서는 NVIDIA GPU를 Compute Engine 인스턴스 및 베어 메탈 인스턴스에 연결하여 인공지능 (AI) 및 머신러닝(ML) 학습, 고성능 컴퓨팅 (HPC), 그래픽 렌더링, 동영상 트랜스코딩과 같은 까다로운 워크로드를 가속화할 수 있습니다.
이 문서에서는 사용 가능한 GPU 모델, 머신 시리즈 매핑, 성능 특성, 이상적인 사용 사례, 가격 책정 고려사항 등 Google Cloud의 GPU를 간략하게 설명합니다.
GPU란 무엇인가요?
GPU는 원래 컴퓨터 그래픽을 위해 설계되었으며 AI, ML, 과학 컴퓨팅을 위한 필수 컴퓨팅 엔진으로 발전한 대규모 병렬 프로세서입니다. 순차적 단일 스레드 처리에 최적화된 강력한 코어가 몇 개 포함된 중앙 처리 장치 (CPU)와 달리 GPU는 대규모 데이터 세트에서 동시에 수학적 계산을 실행하도록 설계된 작고 효율적인 코어가 수천 개로 구성되어 있습니다.
GPU 시스템의 주요 아키텍처 구성요소는 다음과 같습니다.
CUDA 코어: 단일 명령, 다중 스레드 (SIMT) 아키텍처를 사용하여 여러 병렬 스레드에서 동시에 명령어를 실행하는 범용 벡터 처리 장치입니다. CUDA 코어는 표준 벡터 및 부동 소수점 계산 (예: FP32 및 FP64)은 물론 일반 그래픽 렌더링 및 물리 시뮬레이션을 처리합니다.
텐서 코어: 신경망 계산을 가속화하도록 설계된 특수 행렬 곱셈-누적 (MMA) 처리 장치입니다. 텐서 코어는 FP4, FP8, INT8, TF32, FP16/BF16을 비롯한 전문 숫자 정밀도 형식에서 AI 학습 및 추론을 기하급수적으로 가속화합니다.
고대역폭 메모리: 고대역폭 메모리 (HBM) 또는 그래픽 더블 데이터 속도 (GDDR)와 같이 초당 최대 수 테라바이트 (TBps)의 대역폭을 제공하는 전용 온디바이스 메모리입니다. 이 높은 처리량은 집약적인 행렬 연산 중에 수천 개의 GPU 코어에 데이터를 공급합니다.
고속 상호 연결 (NVLink 및 NVSwitch): 동일한 서버 또는 노드 간에 여러 GPU를 연결하는 고대역폭, 짧은 지연 시간 상호 연결 기술입니다. NVLink는 더 느린 PCIe 버스를 우회하는 직접 GPU 간 통신을 제공하여 GPU 클러스터가 일관된 단일 가속기 메모리 풀로 작동할 수 있도록 지원합니다.
가상 워크스테이션 소프트웨어 (NVIDIA RTX vWS): 원격 시각 워크스테이션, 컴퓨터 지원 설계 (CAD), 디지털 콘텐츠 제작, 3D 모델링을 위한 가상화된 그래픽 가속을 제공하는 엔터프라이즈 소프트웨어입니다.
GPU 모델 및 머신 시리즈
Google Cloud 는 다양한 워크로드 및 예산 요구사항을 충족하기 위해 여러 세대에 걸쳐 NVIDIA GPU를 제공합니다. Compute Engine에서 GPU는 사전 구성된 가속기 최적화 머신 시리즈 (A 및 G 시리즈) 또는 범용 N1 머신 시리즈의 연결 가능한 가속기로 사용할 수 있습니다.
다음 표에는 Compute Engine에서 사용할 수 있는 GPU 모델의 하드웨어 사양, 머신 시리즈 매핑, 네트워킹 대역폭, 스토리지 기능이 요약되어 있습니다.
| GPU 모델 | 머신 시리즈 | 아키텍처 | GPU 메모리 및 대역폭 | 컴퓨팅 인스턴스당 GPU | 최대 네트워크 대역폭 | 로컬 SSD | Interconnect | NVIDIA RTX 가상 워크스테이션(vWS) 지원 |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | 279GB HBM3e (8TBps) | 4 (NVL72) | 3,600Gbps | 12,000GiB | NVLink 풀 메시 (1,800GBps) | 아니요 |
| NVIDIA GB200 | A4X | Blackwell | 186GB HBM3e (8TBps) | 4 (NVL72) | 2,000Gbps | 12,000GiB | NVLink 풀 메시 (1,800GBps) | 아니요 |
| NVIDIA B200 | A4 | Blackwell | 180GB HBM3e (8TBps) | 8 | 3,600Gbps | 12,000GiB | NVLink 풀 메시 (1,800GBps) | 아니요 |
| NVIDIA H200 | A3 Ultra | 호퍼 | 141GB HBM3e (4.8TBps) | 8 | 3,600Gbps | 12,000GiB | NVLink 풀 메시 (900GBps) | 아니요 |
| NVIDIA H100 | A3 Mega, High, Edge | 호퍼 | 80GB HBM3 (3.35TBps) | 1, 2, 4, 8 | 최대 1,000Gbps | 최대 6,000GiB | NVLink 풀 메시 (900GBps) | 아니요 |
| NVIDIA A100(80GB) | A2 Ultra | Ampere | 80GB HBM2e (1.9TBps) | 1, 2, 4, 8 | 100Gbps | 최대 3,000GiB | NVLink 풀 메시 (600GBps) | 아니요 |
| NVIDIA A100(40GB) | A2 표준 | Ampere | 40GB HBM2 (1.6TBps) | 1, 2, 4, 8, 16 | 100Gbps | 최대 3,000GiB | NVLink 풀 메시 (600GBps) | 아니요 |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96GB GDDR7 (1.597TBps) | 1/8, 1/4, 1/2, 1, 2, 4, 8 | 200Gbps | 최대 3,000GiB | PCIe 5세대 | 예 |
| NVIDIA L4 | G2 | 에이다 러브레이스 | 24GB GDDR6 (300GBps) | 1, 2, 4, 8 | 100Gbps | 최대 3,000GiB | PCIe 4세대 | 예 |
| NVIDIA T4 (지원 종료 예정) |
N1+T4 | Turing | 16GB GDDR6 (320GBps) | 1, 2, 4 | 100Gbps | 지원됨 | PCIe 3세대 | 예 |
| NVIDIA V100 | N1+V100 | Volta | 16GB HBM2 (900GBps) | 1, 2, 4, 8 | 100Gbps | 지원됨 | NVLink 링 (300GBps) | 아니요 |
| NVIDIA P100 (지원 종료 예정) |
N1+P100 | 파스칼 | 16GB HBM2 (732GBps) | 1, 2, 4 | 100Gbps | 지원됨 | PCIe 3세대 | 예 |
| NVIDIA P4 (지원 종료가 임박함) |
N1+P4 | 파스칼 | 8GB GDDR5 (192GBps) | 1, 2, 4 | 100Gbps | 지원됨 | PCIe 3세대 | 예 |
GPU 성능 특성
적절한 GPU 모델의 선택은 워크로드의 컴퓨팅 특성, 메모리 요구사항, 정밀도 형식, 확장성 요구사항에 따라 달라집니다.
이상적인 사용 사례 및 워크로드 요구사항
GPU는 AI, 시각적 컴퓨팅, 과학적 모델링 전반에서 다양한 컴퓨팅 워크로드를 가속화합니다. 각 워크로드 카테고리의 아키텍처 요구사항을 이해하려면 다음 탭 중 하나를 선택하세요.
AI/ML 학습
최첨단 파운데이션 모델 및 전문가 망 (MoE): 대규모 트랜스포머 모델, 멀티모달 아키텍처, 전문가 망 (MoE) 네트워크를 사전 학습하려면 다중 노드 동기화 지연 시간을 최소화하기 위해 높은 Tensor Core 처리량, 대규모 고대역폭 메모리 (HBM) 용량 (GPU당 최대 279GB), 초고속 NVLink 상호 연결 대역폭 (최대 1,800GBps)이 필요합니다. 권장 머신 시리즈:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
자세한 내용은 AI 하이퍼컴퓨터 문서의 모델 사전 학습 권장사항을 참고하세요.
세부 조정 및 적당한 모델 학습: 파라미터 효율적 세부 조정 (PEFT) 및 LoRA (Low-Rank Adaptation)와 같은 기법을 사용하여 기존 파운데이션 모델을 적응시키려면 엑사스케일 다중 노드 클러스터링이 필요하지 않으면서 모델 가중치와 그라데이션을 보유할 수 있는 충분한 GPU 메모리가 필요합니다. 권장 머신 시리즈:
자세한 내용은 AI 하이퍼컴퓨터 문서의 모델 미세 조정 권장사항을 참고하세요.
AI/ML 추론
대규모 모델 추론(700억 개 이상의 매개변수): 대규모 대규모 언어 모델(LLM)을 제공하면 GPU당 141~186GB의 높은 고대역폭 메모리(HBM3e) 용량을 활용하여 더 적은 수의 GPU에 모델 가중치를 맞출 수 있으므로 칩 간 통신 오버헤드가 줄어듭니다. 권장 머신 시리즈:
높은 처리량과 실시간 서빙: 짧은 지연 시간의 대화형 쿼리, 스트리밍 응답, 이미지 생성은 하드웨어 가속 양자화된 숫자 형식(예: 8비트 부동 소수점(FP8), 8비트 정수(INT8), 4비트 정수(INT4))을 사용하여 달러당 요청 처리량을 극대화합니다. 권장 머신 시리즈:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge 및 High (NVIDIA H100)
자세한 내용은 AI 하이퍼컴퓨터 문서의 추론 제공 권장사항을 참고하세요.
그래픽 및 시각적 컴퓨팅
3D CAD, 디지털 트윈, 가상 워크스테이션: 대화형 3D 모델링, 컴퓨터 지원 설계 (CAD), 건축 렌더링, 디지털 트윈 (예: NVIDIA Omniverse)은 전용 광선 추적 (RT) 코어와 NVIDIA RTX 가상 워크스테이션 (vWS)을 사용하여 원격 시각적 워크스테이션과 부분 가상 GPU (vGPU)를 지원합니다. 권장 머신 시리즈:
동영상 처리 및 트랜스코딩: 라이브 스트리밍 파이프라인, 동영상 트랜스코딩, 미디어 처리에서는 AV1, 고효율 동영상 코딩 (HEVC), H.264 코덱을 지원하는 전용 하드웨어 NVIDIA 인코더 (NVENC) 및 NVIDIA 디코더 (NVDEC) 동영상 엔진을 사용합니다. 권장 머신 시리즈:
HPC 및 시뮬레이션
워크로드 고려사항
GPU는 일반적으로 다음 워크로드에 적합하지 않습니다.
- 순차적 단일 스레드 로직: 순차적 결정 분기 또는 직렬 실행 파이프라인이 지배하는 작업은 단일 코어 클럭 주파수가 높은 CPU에서 더 나은 성능을 보입니다.
- 표준 웹 애플리케이션 및 마이크로서비스: AI 또는 그래픽 처리 요구사항이 없는 범용 웹 서버, 관계형 데이터베이스 관리 시스템 (RDBMS), 표준 API 백엔드는 GPU 가속의 이점을 누릴 수 없습니다. 이러한 워크로드는 범용 또는 컴퓨팅 최적화 CPU 인스턴스에서 더 비용 효율적으로 호스팅됩니다.
- XLA 및 그래프 컴파일 프레임워크에 최적화된 워크로드: 딥 러닝 모델이 JAX, PyTorch/XLA 또는 TensorFlow와 같은 프레임워크를 사용하여 빌드된 경우 컴파일러 기반 그래프 최적화 (XLA)를 활용할 수 있습니다. 모델이 맞춤 행렬 시스톨릭 어레이와 광학 회로 전환의 이점도 누리는 경우 이러한 특정 실행 패러다임을 위해 설계된 대체 액셀러레이터 아키텍처를 평가해 보세요.
가격 책정 고려사항
다음 요소에 따라 Google Cloud의 GPU 가격이 결정됩니다.
구체적인 GPU 모델입니다.
연결된 GPU 수입니다.
프로비저닝된 리소스(예: vCPU, 시스템 메모리, 스토리지)
선택한 가격 모델입니다.
다음 섹션에서는 Google Cloud의 GPU에 사용할 수 있는 가격 모델과 할인 옵션을 간략하게 설명합니다.
소비 및 구매 모델
가용성 요구사항과 비용 허용 범위에 따라 여러 소비 옵션을 사용하여 GPU 인스턴스를 프로비저닝할 수 있습니다.
주문형: 장기 약정 없이 초당 청구되는 표준 사용한 만큼만 지불 (PAYG) 가격 책정입니다. 온디맨드 인스턴스는 개발, 테스트, 가변 프로덕션 워크로드에 대한 완전한 수명 주기 유연성을 제공합니다.
스팟 VM: 잉여Google Cloud 용량을 사용하는 대폭 할인된 컴퓨팅 인스턴스 (주문형 요금 최대 60~91% 할인)입니다. Google Cloud 은 30초 전에 통지하고 용량을 확보하기 위해 스팟 VM을 중지하거나 삭제할 수 있으므로 이러한 컴퓨팅 인스턴스는 내결함성 일괄 ML 학습, 체크포인트가 지정된 일괄 작업, 분산 데이터 처리에 적합합니다.
Flex-start VM: 동적 워크로드 스케줄러 (DWS)를 기반으로 하는 동적 예약 옵션으로, 할인된 요금으로 고정 기간 워크로드 (최대 7일)에 대해 지정된 기간 내에 GPU 리소스를 프로비저닝합니다.
예약:
할인 옵션
약정 사용 할인 (CUD): 특정 리전에서 지속적인 리소스 사용 수준을 유지하겠다는 약속에 대한 대가로 상당한 할인 (3년 약정의 경우 최대 55%, 1년 약정의 경우 최대 37%)을 제공합니다. 가속기 최적화 머신 유형 및 연결된 GPU의 경우 CUD를 받으려면 예약에 연결된 리소스 기반 약정을 구매해야 합니다.
지속 사용 할인 (SUD): 청구 대상 월의 25% 이상 실행되는 N1 컴퓨팅 인스턴스 및 연결된 GPU에 적용되는 자동 할인입니다. 가속기 최적화 머신 시리즈 (A 및 G 시리즈)에는 SUD가 제공되지 않습니다.
모든 리전의 시간별 및 월별 가격 책정은 GPU 가격 책정 페이지 및 VM 인스턴스 가격 책정 페이지를 참고하세요.
모든 가속기 머신 유형에서 소비 옵션 사용 가능성에 관한 자세한 기능 매트릭스는 머신 유형별 소비 옵션 사용 가능성을 참고하세요.
다음 단계
- 가속기 최적화 머신 계열의 GPU 머신을 살펴봅니다.
- 연결된 GPU가 있는 VM 만들기 방법을 알아봅니다.
- Google Cloud의 슈퍼컴퓨팅 AI 아키텍처는 AI 하이퍼컴퓨터 개요에서 확인할 수 있습니다.