Memahami GPU

Unit pemrosesan grafis (GPU) adalah akselerator hardware khusus yang didesain untuk memproses workload paralel secara besar-besaran secara bersamaan. Di Google Cloud, Anda dapat melampirkan GPU NVIDIA ke instance Compute Engine dan instance bare metal untuk mempercepat workload yang berat, seperti pelatihan kecerdasan buatan (AI) dan machine learning (ML), komputasi berperforma tinggi (HPC), rendering grafis, dan transkode video.

Dokumen ini memberikan ringkasan GPU di Google Cloud, termasuk model GPU yang tersedia, pemetaan seri mesin, karakteristik performa, kasus penggunaan yang ideal, dan pertimbangan harga.

Apa itu GPU?

GPU adalah pemroses paralel berskala besar yang awalnya dirancang untuk grafis komputer dan telah berkembang menjadi mesin komputasi penting untuk AI, ML, dan komputasi ilmiah. Tidak seperti unit pemrosesan sentral (CPU), yang berisi beberapa core berperforma tinggi yang dioptimalkan untuk pemrosesan berurutan dan ber-thread tunggal, GPU terdiri dari ribuan core yang lebih kecil dan sangat efisien yang dirancang untuk melakukan perhitungan matematika secara bersamaan di seluruh set data besar.

Komponen arsitektur utama sistem GPU adalah sebagai berikut:

  • Inti CUDA: unit pemrosesan vektor serbaguna yang menjalankan instruksi di beberapa thread paralel secara bersamaan dengan menggunakan arsitektur single instruction, multiple threads (SIMT). Inti CUDA menangani vektor standar dan komputasi floating point (seperti FP32 dan FP64), serta rendering grafis umum dan simulasi fisik.

  • Tensor Cores: unit pemrosesan multiply-accumulate (MMA) matriks khusus yang dirancang untuk mempercepat penghitungan jaringan neural. Tensor Core memberikan peningkatan kecepatan eksponensial untuk pelatihan dan inferensi AI di berbagai format presisi numerik khusus, termasuk FP4, FP8, INT8, TF32, dan FP16/BF16.

  • Memori bandwidth tinggi: memori khusus di perangkat yang memberikan bandwidth hingga beberapa terabyte per detik (TBps), seperti High Bandwidth Memory (HBM) atau Graphics Double Data Rate (GDDR). Throughput tinggi ini membuat ribuan core GPU tetap disuplai data selama operasi matriks intensif.

  • Interkoneksi berkecepatan tinggi (NVLink dan NVSwitch): teknologi interkoneksi bandwidth tinggi dan latensi rendah yang menghubungkan beberapa GPU di server yang sama atau di seluruh node. NVLink menyediakan komunikasi langsung antar-GPU yang melewati bus PCIe yang lebih lambat, sehingga memungkinkan cluster GPU berfungsi sebagai satu kumpulan memori akselerator yang koheren.

  • Software workstation virtual (NVIDIA RTX vWS): software tingkat perusahaan yang menyediakan akselerasi grafis virtual untuk workstation visual jarak jauh, desain berbantuan komputer (CAD), pembuatan konten digital, dan pemodelan 3D.

Model GPU dan seri mesin

Google Cloud menawarkan GPU NVIDIA dari berbagai generasi untuk memenuhi berbagai kebutuhan workload dan anggaran. Di Compute Engine, GPU tersedia sebagai seri mesin yang dioptimalkan untuk akselerator yang telah dikonfigurasi sebelumnya (seri A dan G) atau sebagai akselerator yang dapat dilampirkan pada seri mesin N1 tujuan umum.

Tabel berikut merangkum spesifikasi hardware, pemetaan seri mesin, bandwidth jaringan, dan kemampuan penyimpanan model GPU yang tersedia di Compute Engine:

Model GPU Seri mesin Arsitektur Memori dan bandwidth GPU GPU per instance komputasi Bandwidth jaringan maksimum SSD Lokal Interkoneksi Dukungan NVIDIA RTX Virtual Workstation (vWS)
NVIDIA GB300 A4X Max Blackwell Ultra HBM3e 279 GB (8 TBps) 4 (NVL72) 3.600 Gbps 12.000 GiB NVLink Full Mesh (1.800 GBps) Tidak
NVIDIA GB200 A4X Blackwell HBM3e 186 GB (8 TBps) 4 (NVL72) 2.000 Gbps 12.000 GiB NVLink Full Mesh (1.800 GBps) Tidak
NVIDIA B200 A4 Blackwell HBM3e 180 GB (8 TBps) 8 3.600 Gbps 12.000 GiB NVLink Full Mesh (1.800 GBps) Tidak
NVIDIA H200 A3 Ultra Hopper HBM3e 141 GB (4,8 TBps) 8 3.600 Gbps 12.000 GiB NVLink Full Mesh (900 GBps) Tidak
NVIDIA H100 A3 Mega, High, Edge Hopper HBM3 80 GB (3,35 TBps) 1, 2, 4, 8 Hingga 1.000 Gbps Hingga 6.000 GiB NVLink Full Mesh (900 GBps) Tidak
NVIDIA A100 (80GB) A2 Ultra Ampere HBM2e 80 GB (1,9 TBps) 1, 2, 4, 8 100 Gbps Hingga 3.000 GiB NVLink Full Mesh (600 GBps) Tidak
NVIDIA A100 (40GB) A2 Standard Ampere HBM2 40 GB (1,6 TBps) 1, 2, 4, 8, 16 100 Gbps Hingga 3.000 GiB NVLink Full Mesh (600 GBps) Tidak
NVIDIA RTX PRO 6000 G4 Blackwell 96 GB GDDR7 (1.597 TBps) 1/8, 1/4, 1/2, 1, 2, 4, 8 200 Gbps Hingga 3.000 GiB PCIe Gen 5 Ya
NVIDIA L4 G2 Ada Lovelace 24 GB GDDR6 (300 GBps) 1, 2, 4, 8 100 Gbps Hingga 3.000 GiB PCIe Gen 4 Ya
NVIDIA T4
(Mendekati akhir dukungan)
N1+T4 Turing 16 GB GDDR6 (320 GB/dtk) 1, 2, 4 100 Gbps Didukung PCIe Gen 3 Ya
NVIDIA V100 N1+V100 Volta 16 GB HBM2 (900 GBps) 1, 2, 4, 8 100 Gbps Didukung NVLink Ring (300 GBps) Tidak
NVIDIA P100
(Mendekati akhir dukungan)
N1+P100 Pascal 16 GB HBM2 (732 GBps) 1, 2, 4 100 Gbps Didukung PCIe Gen 3 Ya
NVIDIA P4
(Mendekati akhir dukungan)
N1+P4 Pascal 8 GB GDDR5 (192 GBps) 1, 2, 4 100 Gbps Didukung PCIe Gen 3 Ya

Karakteristik performa GPU

Memilih model GPU yang tepat bergantung pada karakteristik komputasi, persyaratan memori, format presisi, dan kebutuhan skalabilitas workload Anda.

Kasus penggunaan yang ideal dan persyaratan workload

GPU mempercepat beragam workload komputasi di seluruh AI, komputasi visual, dan pemodelan ilmiah. Untuk memahami persyaratan arsitektur untuk setiap kategori beban kerja, pilih salah satu tab berikut:

Pelatihan AI/ML

Inferensi AI/ML

  • Inferensi model besar (lebih dari 70 miliar parameter): penayangan model bahasa besar (LLM) dalam jumlah besar diuntungkan dari kapasitas High Bandwidth Memory (HBM3e) yang tinggi (141–186 GB per GPU) untuk menyesuaikan bobot model di lebih sedikit GPU, sehingga mengurangi overhead komunikasi antar-chip. Seri mesin yang direkomendasikan:

  • Penayangan real-time dan throughput tinggi: kueri interaktif latensi rendah, respons streaming, dan pembuatan gambar menggunakan format numerik terkuantisasi yang dipercepat hardware, seperti floating-point 8-bit (FP8), bilangan bulat 8-bit (INT8), dan bilangan bulat 4-bit (INT4), untuk memaksimalkan throughput permintaan per dolar. Seri mesin yang direkomendasikan:

    Untuk mengetahui informasi selengkapnya, lihat Rekomendasi untuk menayangkan inferensi dalam dokumentasi AI Hypercomputer.

Grafis dan komputasi visual

HPC dan simulasi

  • Simulasi dan pemodelan ilmiah: aplikasi dalam dinamika molekuler (seperti GROMACS dan AMBER), dinamika fluida komputasional (CFD), kimia kuantum, astrofisika, dan prakiraan cuaca memerlukan performa floating point presisi ganda (FP64) 64-bit yang tinggi dan bandwidth memori yang tinggi. Seri mesin yang direkomendasikan:

    • A4X (NVIDIA GB200)
    • A4 (NVIDIA B200)
    • A3 (NVIDIA H100)
    • A2 (NVIDIA A100)

    Untuk mengetahui informasi selengkapnya, lihat Rekomendasi untuk HPC dalam dokumentasi AI Hypercomputer.

Pertimbangan workload

GPU biasanya tidak cocok untuk workload berikut:

  • Logika berurutan dan ber-thread tunggal: tugas yang didominasi oleh cabang keputusan berurutan atau pipeline eksekusi serial berperforma lebih baik di CPU dengan frekuensi clock inti tunggal yang tinggi.
  • Aplikasi web dan microservice standar: server web tujuan umum, sistem manajemen database relasional (RDBMS), dan backend API standar tanpa persyaratan pemrosesan AI atau grafis tidak mendapatkan manfaat dari akselerasi GPU. Workload ini dihosting secara lebih hemat biaya di instance CPU tujuan umum atau yang dioptimalkan untuk komputasi.
  • Workload yang dioptimalkan untuk XLA dan framework yang dikompilasi grafik: jika model deep learning Anda dibangun menggunakan framework seperti JAX, PyTorch/XLA, atau TensorFlow, model tersebut dapat memanfaatkan pengoptimalan grafik yang didorong oleh compiler (XLA). Jika model Anda juga mendapatkan manfaat dari array sistolik matriks kustom dan pengalihan sirkuit optik, pertimbangkan untuk mengevaluasi arsitektur akselerator alternatif yang dirancang untuk paradigma eksekusi tertentu tersebut.

Pertimbangan harga

Faktor berikut menentukan harga GPU di Google Cloud:

  • Model GPU tertentu.

  • Jumlah GPU yang terpasang.

  • Resource yang disediakan, seperti vCPU, memori sistem, dan penyimpanan.

  • Model pemakaian yang Anda pilih.

Bagian berikut menguraikan model penggunaan dan opsi diskon yang tersedia untuk GPU di Google Cloud.

Model konsumsi dan pembelian

Anda dapat menyediakan instance GPU menggunakan beberapa opsi penggunaan, bergantung pada persyaratan ketersediaan dan toleransi biaya Anda:

  • On-demand: harga bayar sesuai penggunaan (PAYG) standar yang ditagih per detik tanpa komitmen jangka panjang. Instance on-demand menawarkan fleksibilitas siklus proses yang lengkap untuk pengembangan, pengujian, dan workload produksi yang bervariasi.

  • Spot VM: instance komputasi yang sangat didiskon (hingga 60–91% dari tarif sesuai permintaan) yang diambil dari kapasitasGoogle Cloud surplus. Karena Google Cloud dapat menghentikan atau menghapus Spot VM untuk mendapatkan kembali kapasitas dengan pemberitahuan 30 detik, instance komputasi ini ideal untuk pelatihan ML batch yang fault-tolerant, tugas batch yang diberi checkpoint, dan pemrosesan data terdistribusi.

  • VM mulai fleksibel: opsi penjadwalan dinamis yang didukung oleh Dynamic Workload Scheduler (DWS) yang menyediakan resource GPU dalam jangka waktu tertentu untuk workload berdurasi tetap (hingga 7 hari) dengan tarif diskon.

  • Reservasi:

    • Reservasi: Anda dapat memesan kapasitas untuk GPU standar dan langsung menggunakan kapasitas yang dipesan.
    • Pemesanan untuk masa mendatang (mode kalender dan AI Hypercomputer): Anda dapat meminta untuk memesan kapasitas GPU yang dikelompokkan untuk tanggal dan waktu mendatang. Jika Google Cloud menyetujui permintaan Anda, Anda dapat mulai menggunakan kapasitas pada waktu yang ditentukan dan mempertahankan akses eksklusif hingga akhir masa berlaku reservasi.

Opsi diskon

  • Diskon abonemen (CUD): memberikan diskon yang signifikan (hingga 55% untuk komitmen 3 tahun atau 37% untuk komitmen 1 tahun) sebagai imbalan atas komitmen untuk mempertahankan tingkat penggunaan resource yang berkelanjutan di region tertentu. Untuk jenis mesin yang dioptimalkan akselerator dan GPU terlampir, CUD memerlukan pembelian komitmen berbasis resource yang dilampirkan ke reservasi.

  • Diskon untuk penggunaan berkelanjutan (SUD): diskon otomatis yang diterapkan pada instance komputasi N1 dan GPU terlampir saat dijalankan selama lebih dari 25% dalam bulan penagihan. Seri mesin yang dioptimalkan akselerator (seri A dan G) tidak menerima SUD.

Untuk mengetahui harga per jam dan bulanan yang mendetail di semua region, lihat halaman harga GPU dan halaman harga instance VM.

Untuk mengetahui matriks fitur mendetail tentang ketersediaan opsi konsumsi di semua jenis mesin akselerator, lihat Ketersediaan opsi konsumsi menurut jenis mesin.

Langkah berikutnya