Unit pemrosesan grafis (GPU) adalah akselerator hardware khusus yang didesain untuk memproses workload paralel secara besar-besaran secara bersamaan. Di Google Cloud, Anda dapat melampirkan GPU NVIDIA ke instance Compute Engine dan instance bare metal untuk mempercepat workload yang berat, seperti pelatihan kecerdasan buatan (AI) dan machine learning (ML), komputasi berperforma tinggi (HPC), rendering grafis, dan transkode video.
Dokumen ini memberikan ringkasan GPU di Google Cloud, termasuk model GPU yang tersedia, pemetaan seri mesin, karakteristik performa, kasus penggunaan yang ideal, dan pertimbangan harga.
Apa itu GPU?
GPU adalah pemroses paralel berskala besar yang awalnya dirancang untuk grafis komputer dan telah berkembang menjadi mesin komputasi penting untuk AI, ML, dan komputasi ilmiah. Tidak seperti unit pemrosesan sentral (CPU), yang berisi beberapa core berperforma tinggi yang dioptimalkan untuk pemrosesan berurutan dan ber-thread tunggal, GPU terdiri dari ribuan core yang lebih kecil dan sangat efisien yang dirancang untuk melakukan perhitungan matematika secara bersamaan di seluruh set data besar.
Komponen arsitektur utama sistem GPU adalah sebagai berikut:
Inti CUDA: unit pemrosesan vektor serbaguna yang menjalankan instruksi di beberapa thread paralel secara bersamaan dengan menggunakan arsitektur single instruction, multiple threads (SIMT). Inti CUDA menangani vektor standar dan komputasi floating point (seperti FP32 dan FP64), serta rendering grafis umum dan simulasi fisik.
Tensor Cores: unit pemrosesan multiply-accumulate (MMA) matriks khusus yang dirancang untuk mempercepat penghitungan jaringan neural. Tensor Core memberikan peningkatan kecepatan eksponensial untuk pelatihan dan inferensi AI di berbagai format presisi numerik khusus, termasuk FP4, FP8, INT8, TF32, dan FP16/BF16.
Memori bandwidth tinggi: memori khusus di perangkat yang memberikan bandwidth hingga beberapa terabyte per detik (TBps), seperti High Bandwidth Memory (HBM) atau Graphics Double Data Rate (GDDR). Throughput tinggi ini membuat ribuan core GPU tetap disuplai data selama operasi matriks intensif.
Interkoneksi berkecepatan tinggi (NVLink dan NVSwitch): teknologi interkoneksi bandwidth tinggi dan latensi rendah yang menghubungkan beberapa GPU di server yang sama atau di seluruh node. NVLink menyediakan komunikasi langsung antar-GPU yang melewati bus PCIe yang lebih lambat, sehingga memungkinkan cluster GPU berfungsi sebagai satu kumpulan memori akselerator yang koheren.
Software workstation virtual (NVIDIA RTX vWS): software tingkat perusahaan yang menyediakan akselerasi grafis virtual untuk workstation visual jarak jauh, desain berbantuan komputer (CAD), pembuatan konten digital, dan pemodelan 3D.
Model GPU dan seri mesin
Google Cloud menawarkan GPU NVIDIA dari berbagai generasi untuk memenuhi berbagai kebutuhan workload dan anggaran. Di Compute Engine, GPU tersedia sebagai seri mesin yang dioptimalkan untuk akselerator yang telah dikonfigurasi sebelumnya (seri A dan G) atau sebagai akselerator yang dapat dilampirkan pada seri mesin N1 tujuan umum.
Tabel berikut merangkum spesifikasi hardware, pemetaan seri mesin, bandwidth jaringan, dan kemampuan penyimpanan model GPU yang tersedia di Compute Engine:
| Model GPU | Seri mesin | Arsitektur | Memori dan bandwidth GPU | GPU per instance komputasi | Bandwidth jaringan maksimum | SSD Lokal | Interkoneksi | Dukungan NVIDIA RTX Virtual Workstation (vWS) |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | HBM3e 279 GB (8 TBps) | 4 (NVL72) | 3.600 Gbps | 12.000 GiB | NVLink Full Mesh (1.800 GBps) | Tidak |
| NVIDIA GB200 | A4X | Blackwell | HBM3e 186 GB (8 TBps) | 4 (NVL72) | 2.000 Gbps | 12.000 GiB | NVLink Full Mesh (1.800 GBps) | Tidak |
| NVIDIA B200 | A4 | Blackwell | HBM3e 180 GB (8 TBps) | 8 | 3.600 Gbps | 12.000 GiB | NVLink Full Mesh (1.800 GBps) | Tidak |
| NVIDIA H200 | A3 Ultra | Hopper | HBM3e 141 GB (4,8 TBps) | 8 | 3.600 Gbps | 12.000 GiB | NVLink Full Mesh (900 GBps) | Tidak |
| NVIDIA H100 | A3 Mega, High, Edge | Hopper | HBM3 80 GB (3,35 TBps) | 1, 2, 4, 8 | Hingga 1.000 Gbps | Hingga 6.000 GiB | NVLink Full Mesh (900 GBps) | Tidak |
| NVIDIA A100 (80GB) | A2 Ultra | Ampere | HBM2e 80 GB (1,9 TBps) | 1, 2, 4, 8 | 100 Gbps | Hingga 3.000 GiB | NVLink Full Mesh (600 GBps) | Tidak |
| NVIDIA A100 (40GB) | A2 Standard | Ampere | HBM2 40 GB (1,6 TBps) | 1, 2, 4, 8, 16 | 100 Gbps | Hingga 3.000 GiB | NVLink Full Mesh (600 GBps) | Tidak |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96 GB GDDR7 (1.597 TBps) | 1/8, 1/4, 1/2, 1, 2, 4, 8 | 200 Gbps | Hingga 3.000 GiB | PCIe Gen 5 | Ya |
| NVIDIA L4 | G2 | Ada Lovelace | 24 GB GDDR6 (300 GBps) | 1, 2, 4, 8 | 100 Gbps | Hingga 3.000 GiB | PCIe Gen 4 | Ya |
| NVIDIA T4 (Mendekati akhir dukungan) |
N1+T4 | Turing | 16 GB GDDR6 (320 GB/dtk) | 1, 2, 4 | 100 Gbps | Didukung | PCIe Gen 3 | Ya |
| NVIDIA V100 | N1+V100 | Volta | 16 GB HBM2 (900 GBps) | 1, 2, 4, 8 | 100 Gbps | Didukung | NVLink Ring (300 GBps) | Tidak |
| NVIDIA P100 (Mendekati akhir dukungan) |
N1+P100 | Pascal | 16 GB HBM2 (732 GBps) | 1, 2, 4 | 100 Gbps | Didukung | PCIe Gen 3 | Ya |
| NVIDIA P4 (Mendekati akhir dukungan) |
N1+P4 | Pascal | 8 GB GDDR5 (192 GBps) | 1, 2, 4 | 100 Gbps | Didukung | PCIe Gen 3 | Ya |
Karakteristik performa GPU
Memilih model GPU yang tepat bergantung pada karakteristik komputasi, persyaratan memori, format presisi, dan kebutuhan skalabilitas workload Anda.
Kasus penggunaan yang ideal dan persyaratan workload
GPU mempercepat beragam workload komputasi di seluruh AI, komputasi visual, dan pemodelan ilmiah. Untuk memahami persyaratan arsitektur untuk setiap kategori beban kerja, pilih salah satu tab berikut:
Pelatihan AI/ML
Model dasar Frontier dan campuran pakar (MoE): pra-pelatihan model transformer besar, arsitektur multimodal, dan jaringan campuran pakar (MoE) memerlukan throughput Tensor Core yang tinggi, kapasitas High Bandwidth Memory (HBM) yang besar (hingga 279 GB per GPU), dan bandwidth interkoneksi NVLink berkecepatan sangat tinggi (hingga 1.800 GBps) untuk meminimalkan latensi sinkronisasi multi-node. Seri mesin yang direkomendasikan:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
Untuk mengetahui informasi selengkapnya, lihat Rekomendasi untuk model pra-pelatihan dalam dokumentasi AI Hypercomputer.
Penyesuaian dan pelatihan model sedang: mengadaptasi model dasar yang ada dengan menggunakan teknik seperti penyesuaian yang efisien parameter (PEFT) dan Low-Rank Adaptation (LoRA) memerlukan memori GPU yang memadai untuk menyimpan bobot dan gradien model tanpa memerlukan pengelompokan multi-node exascale. Seri mesin yang direkomendasikan:
Untuk mengetahui informasi selengkapnya, lihat Rekomendasi untuk menyetel model secara halus dalam dokumentasi AI Hypercomputer.
Inferensi AI/ML
Inferensi model besar (lebih dari 70 miliar parameter): penayangan model bahasa besar (LLM) dalam jumlah besar diuntungkan dari kapasitas High Bandwidth Memory (HBM3e) yang tinggi (141–186 GB per GPU) untuk menyesuaikan bobot model di lebih sedikit GPU, sehingga mengurangi overhead komunikasi antar-chip. Seri mesin yang direkomendasikan:
Penayangan real-time dan throughput tinggi: kueri interaktif latensi rendah, respons streaming, dan pembuatan gambar menggunakan format numerik terkuantisasi yang dipercepat hardware, seperti floating-point 8-bit (FP8), bilangan bulat 8-bit (INT8), dan bilangan bulat 4-bit (INT4), untuk memaksimalkan throughput permintaan per dolar. Seri mesin yang direkomendasikan:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge dan High (NVIDIA H100)
Untuk mengetahui informasi selengkapnya, lihat Rekomendasi untuk menayangkan inferensi dalam dokumentasi AI Hypercomputer.
Grafis dan komputasi visual
CAD 3D, model digital akurat, dan workstation virtual: pemodelan 3D interaktif, desain berbantuan komputer (CAD), rendering arsitektur, dan model digital akurat (seperti NVIDIA Omniverse) menggunakan core ray tracing (RT) khusus dan NVIDIA RTX Virtual Workstations (vWS) untuk workstation visual jarak jauh dan GPU virtual (vGPU) fraksional. Seri mesin yang direkomendasikan:
Pemrosesan dan transkode video: pipeline live streaming, transkode video, dan pemrosesan media menggunakan hardware khusus NVIDIA Encoder (NVENC) dan NVIDIA Decoder (NVDEC) untuk video yang mendukung codec AV1, High Efficiency Video Coding (HEVC), dan H.264. Seri mesin yang direkomendasikan:
HPC dan simulasi
Simulasi dan pemodelan ilmiah: aplikasi dalam dinamika molekuler (seperti GROMACS dan AMBER), dinamika fluida komputasional (CFD), kimia kuantum, astrofisika, dan prakiraan cuaca memerlukan performa floating point presisi ganda (FP64) 64-bit yang tinggi dan bandwidth memori yang tinggi. Seri mesin yang direkomendasikan:
Untuk mengetahui informasi selengkapnya, lihat Rekomendasi untuk HPC dalam dokumentasi AI Hypercomputer.
Pertimbangan workload
GPU biasanya tidak cocok untuk workload berikut:
- Logika berurutan dan ber-thread tunggal: tugas yang didominasi oleh cabang keputusan berurutan atau pipeline eksekusi serial berperforma lebih baik di CPU dengan frekuensi clock inti tunggal yang tinggi.
- Aplikasi web dan microservice standar: server web tujuan umum, sistem manajemen database relasional (RDBMS), dan backend API standar tanpa persyaratan pemrosesan AI atau grafis tidak mendapatkan manfaat dari akselerasi GPU. Workload ini dihosting secara lebih hemat biaya di instance CPU tujuan umum atau yang dioptimalkan untuk komputasi.
- Workload yang dioptimalkan untuk XLA dan framework yang dikompilasi grafik: jika model deep learning Anda dibangun menggunakan framework seperti JAX, PyTorch/XLA, atau TensorFlow, model tersebut dapat memanfaatkan pengoptimalan grafik yang didorong oleh compiler (XLA). Jika model Anda juga mendapatkan manfaat dari array sistolik matriks kustom dan pengalihan sirkuit optik, pertimbangkan untuk mengevaluasi arsitektur akselerator alternatif yang dirancang untuk paradigma eksekusi tertentu tersebut.
Pertimbangan harga
Faktor berikut menentukan harga GPU di Google Cloud:
Model GPU tertentu.
Jumlah GPU yang terpasang.
Resource yang disediakan, seperti vCPU, memori sistem, dan penyimpanan.
Model pemakaian yang Anda pilih.
Bagian berikut menguraikan model penggunaan dan opsi diskon yang tersedia untuk GPU di Google Cloud.
Model konsumsi dan pembelian
Anda dapat menyediakan instance GPU menggunakan beberapa opsi penggunaan, bergantung pada persyaratan ketersediaan dan toleransi biaya Anda:
On-demand: harga bayar sesuai penggunaan (PAYG) standar yang ditagih per detik tanpa komitmen jangka panjang. Instance on-demand menawarkan fleksibilitas siklus proses yang lengkap untuk pengembangan, pengujian, dan workload produksi yang bervariasi.
Spot VM: instance komputasi yang sangat didiskon (hingga 60–91% dari tarif sesuai permintaan) yang diambil dari kapasitasGoogle Cloud surplus. Karena Google Cloud dapat menghentikan atau menghapus Spot VM untuk mendapatkan kembali kapasitas dengan pemberitahuan 30 detik, instance komputasi ini ideal untuk pelatihan ML batch yang fault-tolerant, tugas batch yang diberi checkpoint, dan pemrosesan data terdistribusi.
VM mulai fleksibel: opsi penjadwalan dinamis yang didukung oleh Dynamic Workload Scheduler (DWS) yang menyediakan resource GPU dalam jangka waktu tertentu untuk workload berdurasi tetap (hingga 7 hari) dengan tarif diskon.
Reservasi:
- Reservasi: Anda dapat memesan kapasitas untuk GPU standar dan langsung menggunakan kapasitas yang dipesan.
- Pemesanan untuk masa mendatang (mode kalender dan AI Hypercomputer): Anda dapat meminta untuk memesan kapasitas GPU yang dikelompokkan untuk tanggal dan waktu mendatang. Jika Google Cloud menyetujui permintaan Anda, Anda dapat mulai menggunakan kapasitas pada waktu yang ditentukan dan mempertahankan akses eksklusif hingga akhir masa berlaku reservasi.
Opsi diskon
Diskon abonemen (CUD): memberikan diskon yang signifikan (hingga 55% untuk komitmen 3 tahun atau 37% untuk komitmen 1 tahun) sebagai imbalan atas komitmen untuk mempertahankan tingkat penggunaan resource yang berkelanjutan di region tertentu. Untuk jenis mesin yang dioptimalkan akselerator dan GPU terlampir, CUD memerlukan pembelian komitmen berbasis resource yang dilampirkan ke reservasi.
Diskon untuk penggunaan berkelanjutan (SUD): diskon otomatis yang diterapkan pada instance komputasi N1 dan GPU terlampir saat dijalankan selama lebih dari 25% dalam bulan penagihan. Seri mesin yang dioptimalkan akselerator (seri A dan G) tidak menerima SUD.
Untuk mengetahui harga per jam dan bulanan yang mendetail di semua region, lihat halaman harga GPU dan halaman harga instance VM.
Untuk mengetahui matriks fitur mendetail tentang ketersediaan opsi konsumsi di semua jenis mesin akselerator, lihat Ketersediaan opsi konsumsi menurut jenis mesin.
Langkah berikutnya
- Pelajari mesin GPU dalam kelompok mesin yang dioptimalkan akselerator.
- Pelajari cara Membuat VM dengan GPU yang terpasang.
- Temukan arsitektur AI superkomputer Discover Google Clouddi Ringkasan AI Hypercomputer.