GPU Umum dioptimalkan untuk beban kerja kecerdasan buatan (AI) dan machine learning (ML) yang memprioritaskan fleksibilitas operasional, independensi resource, dan efektivitas biaya.
GPU Umum memungkinkan tim men-deploy dan menskalakan akselerator NVIDIA dengan otonomi operasional yang lengkap, sehingga tidak perlu berurusan dengan kompleksitas arsitektur cluster superkomputer yang terkoordinasi. Layanan ini ideal untuk workload yang memprioritaskan ketersediaan tinggi, penyediaan layanan mandiri, dan penskalaan independen. Kasus penggunaan umum mencakup inferensi real-time, RAG, pembuatan prototipe, dan pelatihan model kecil hingga sedang.
Karakteristik utama GPU Umum
- Fleksibilitas operasional: Anda dapat mengelola resource menggunakan antarmuka GKE (Autopilot dan Standard) dan Compute Engine standar untuk menyederhanakan deployment dan penskalaan.
- Ketersediaan tinggi: Google Cloud memperbarui setiap instance secara independen untuk membantu memastikan update pada satu node tidak memengaruhi ketersediaan node lainnya, sehingga load balancer Anda dapat mengalihkan traffic tanpa menghentikan fleet penayangan.
- Kesederhanaan jaringan: workload Anda menggunakan layanan Virtual Private Cloud (VPC) standar dan TCP/IP standar melalui antarmuka Google Virtual NIC (gVNIC) untuk menghilangkan fabric tingkat hardware yang kompleks.
- Pengoptimalan biaya: Anda dapat menggunakan Spot VM untuk riset fault-tolerant guna menghemat biaya hingga 90% dibandingkan dengan tarif on-demand standar.
- Akuisisi layanan mandiri: Anda dapat memperoleh kapasitas secara langsung melalui reservasi standar dan permintaan sesuai permintaan tanpa memerlukan alur kerja yang dikelola tim akun.
Kelompok GPU umum dan spesifikasi teknis
Tinjau workload dan spesifikasi hardware untuk seri mesin GPU Umum. Untuk penayangan dengan throughput tinggi, gunakan seri A3 Edge.
Seri A3 (Tinggi dengan 1, 2, atau 4 GPU dan Edge)
A3 Tinggi (1, 2, atau 4 GPU)
Jika Anda menjalankan inferensi atau workload pelatihan standar yang memerlukan performa tinggi, tetapi tidak memerlukan cluster yang disinkronkan 8 GPU penuh, gunakan seri mesin A3 High dengan 1, 2, atau 4 GPU terpasang.
Jenis mesin A3 High memiliki GPU NVIDIA H100 SXM dan sangat cocok untuk inferensi model besar dan penyetelan lanjutan model.
| GPU NVIDIA H100 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1.500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3.000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1.872 | 6.000 | 5 | 1.000 | 8 | 640 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
A3 Edge
Jika Anda menjalankan workload inferensi terdistribusi dengan throughput tinggi di beberapa host tanpa fabric cluster yang terkoordinasi, gunakan seri A3 Edge untuk menyederhanakan deployment melalui jaringan pribadi virtual standar.
Jenis mesin A3 Edge memiliki GPU NVIDIA H100 SXM dan dirancang khusus untuk inferensi dan tersedia di sejumlah region terbatas.
| GPU NVIDIA H100 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3) |
a3-edgegpu-8g |
208 | 1.872 | 6.000 | 5 |
|
8 | 640 |
Seri A2 (Standard dan Ultra)
Jika Anda perlu melakukan penayangan model satu node berperforma tinggi atau penyesuaian model skala kecil, gunakan seri mesin A2 untuk mengakses resource GPU NVIDIA A100 khusus.
A2 Ultra
| GPU NVIDIA A100 80 GB terpasang | ||||||
|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM2e) |
a2-ultragpu-1g |
12 | 170 | 375 | 24 | 1 | 80 |
a2-ultragpu-2g |
24 | 340 | 750 | 32 | 2 | 160 |
a2-ultragpu-4g |
48 | 680 | 1.500 | 50 | 4 | 320 |
a2-ultragpu-8g |
96 | 1.360 | 3.000 | 100 | 8 | 640 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
A2 Standard
| GPU NVIDIA A100 40 GB terpasang | ||||||
|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD lokal didukung | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM2) |
a2-highgpu-1g |
12 | 85 | Ya | 24 | 1 | 40 |
a2-highgpu-2g |
24 | 170 | Ya | 32 | 2 | 80 |
a2-highgpu-4g |
48 | 340 | Ya | 50 | 4 | 160 |
a2-highgpu-8g |
96 | 680 | Ya | 100 | 8 | 320 |
a2-megagpu-16g |
96 | 1.360 | Ya | 100 | 16 | 640 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
Seri G4
Jika tim Anda memerlukan inferensi tingkat entri yang hemat biaya atau workload rendering grafis standar, gunakan seri mesin G4 yang dilengkapi GPU NVIDIA RTX PRO 6000.
Jenis mesin G4
menggunakan
GPU NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000)
dan
cocok untuk workload simulasi NVIDIA Omniverse, aplikasi yang intensif secara grafis, transkode
video, dan desktop virtual. Jenis mesin G4 juga memberikan solusi berbiaya rendah untuk
melakukan inferensi host tunggal dan penyesuaian model dibandingkan dengan jenis mesin seri A.
| GPU NVIDIA RTX PRO 6000 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Titanium maksimum yang didukung (GiB)2 | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)3 | Jumlah GPU | Memori GPU4 (GB GDDR7) |
g4-standard-6 |
6 | 22 | 0 | 1 | 20 | 1/8 | 12 |
g4-standard-12 |
12 | 45 | 375 | 1 | 20 | 1/4 | 24 |
g4-standard-24 |
24 | 90 | 750 | 1 | 20 | 1/2 | 48 |
g4-standard-48 |
48 | 180 | 1.500 | 1 | 50 | 1 | 96 |
g4-standard-96 |
96 | 360 | 3.000 | 1 | 100 | 2 | 192 |
g4-standard-192 |
192 | 720 | 6.000 | 1 | 200 | 4 | 384 |
g4-standard-384 |
384 | 1.440 | 12.000 | 2 | 400 | 8 | 768 |
*Memori GPU adalah memori yang tersedia di perangkat GPU yang dapat digunakan untuk penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload yang dipercepat seperti machine learning dan workload yang intensif secara grafis.
Seri G2
Jika Anda men-deploy aplikasi inferensi real-time mainstream atau pipeline Retrieval-Augmented Generation (RAG), gunakan seri mesin G2 untuk menyeimbangkan efisiensi performa dan biaya dengan GPU NVIDIA L4.
| GPU NVIDIA L4 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance default (GB) | Rentang memori instance kustom (GB) | SSD Lokal maksimum yang didukung (GiB) | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB GDDR6) |
g2-standard-4 |
4 | 16 | 16 hingga 32 | 375 | 10 | 1 | 24 |
g2-standard-8 |
8 | 32 | 32 hingga 54 | 375 | 16 | 1 | 24 |
g2-standard-12 |
12 | 48 | 48 hingga 54 tahun | 375 | 16 | 1 | 24 |
g2-standard-16 |
16 | 64 | 54 hingga 64 | 375 | 32 | 1 | 24 |
g2-standard-24 |
24 | 96 | 96 hingga 108 | 750 | 32 | 2 | 48 |
g2-standard-32 |
32 | 128 | 96 hingga 128 | 375 | 32 | 1 | 24 |
g2-standard-48 |
48 | 192 | 192 hingga 216 | 1.500 | 50 | 4 | 96 |
g2-standard-96 |
96 | 384 | 384 hingga 432 | 3.000 | 100 | 8 | 192 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
Seri N1 (NVIDIA T4 atau V100)
Jika prioritas Anda adalah eksperimen yang sensitif terhadap biaya atau menjalankan inferensi tingkat entri dengan konkurensi rendah, gunakan seri mesin N1 untuk melampirkan GPU NVIDIA T4 atau V100.
NVIDIA T4
| Jenis akselerator | Jumlah GPU | Memori GPU1 (GB GDDR6) | Jumlah vCPU | Memori instance (GB) | SSD lokal didukung |
|---|---|---|---|---|---|
nvidia-tesla-t4 atau nvidia-tesla-t4-vws
|
1 | 16 | 1 hingga 48 | 1 hingga 312 | Ya |
| 2 | 32 | 1 hingga 48 | 1 hingga 312 | Ya | |
| 4 | 64 | 1 hingga 96 | 1 hingga 624 | Ya |
NVIDIA V100
| Jenis akselerator | Jumlah GPU | Memori GPU1 (GB HBM2) | Jumlah vCPU | Memori instance (GB) | SSD Lokal didukung2 |
|---|---|---|---|---|---|
nvidia-tesla-v100 |
1 | 16 | 1 hingga 12 | 1 hingga 78 | Ya |
| 2 | 32 | 1 hingga 24 | 1 hingga 156 | Ya | |
| 4 | 64 | 1 hingga 48 | 1 hingga 312 | Ya | |
| 8 | 128 | 1 hingga 96 | 1 hingga 624 | Ya |
Akuisisi kapasitas
Akselerator GPU umum menggunakan penyediaan mandiri standar. Anda dapat memperoleh kapasitas melalui reservasi standar, permintaan sesuai permintaan, atau Spot VM. Karena kapasitas sesuai permintaan dapat mengalami kehabisan stok, gunakan Spot VM atau Flex-start jika memungkinkan.
Langkah berikutnya
- Untuk mempelajari cara mendapatkan kapasitas, lihat Opsi penggunaan.
- Untuk mengevaluasi persyaratan infrastruktur Anda, lihat Memilih infrastruktur.
- Untuk meninjau layanan jaringan untuk GPU, lihat Ringkasan jaringan GPU.
- Untuk meninjau proses dan pilihan yang harus dibuat saat Anda memulai cluster, lihat Merencanakan dan membuat infrastruktur AI Anda.