Ringkasan GPU umum

GPU Umum dioptimalkan untuk beban kerja kecerdasan buatan (AI) dan machine learning (ML) yang memprioritaskan fleksibilitas operasional, independensi resource, dan efektivitas biaya.

GPU Umum memungkinkan tim men-deploy dan menskalakan akselerator NVIDIA dengan otonomi operasional yang lengkap, sehingga tidak perlu berurusan dengan kompleksitas arsitektur cluster superkomputer yang terkoordinasi. Layanan ini ideal untuk workload yang memprioritaskan ketersediaan tinggi, penyediaan layanan mandiri, dan penskalaan independen. Kasus penggunaan umum mencakup inferensi real-time, RAG, pembuatan prototipe, dan pelatihan model kecil hingga sedang.

Karakteristik utama GPU Umum

  • Fleksibilitas operasional: Anda dapat mengelola resource menggunakan antarmuka GKE (Autopilot dan Standard) dan Compute Engine standar untuk menyederhanakan deployment dan penskalaan.
  • Ketersediaan tinggi: Google Cloud memperbarui setiap instance secara independen untuk membantu memastikan update pada satu node tidak memengaruhi ketersediaan node lainnya, sehingga load balancer Anda dapat mengalihkan traffic tanpa menghentikan fleet penayangan.
  • Kesederhanaan jaringan: workload Anda menggunakan layanan Virtual Private Cloud (VPC) standar dan TCP/IP standar melalui antarmuka Google Virtual NIC (gVNIC) untuk menghilangkan fabric tingkat hardware yang kompleks.
  • Pengoptimalan biaya: Anda dapat menggunakan Spot VM untuk riset fault-tolerant guna menghemat biaya hingga 90% dibandingkan dengan tarif on-demand standar.
  • Akuisisi layanan mandiri: Anda dapat memperoleh kapasitas secara langsung melalui reservasi standar dan permintaan sesuai permintaan tanpa memerlukan alur kerja yang dikelola tim akun.

Kelompok GPU umum dan spesifikasi teknis

Tinjau workload dan spesifikasi hardware untuk seri mesin GPU Umum. Untuk penayangan dengan throughput tinggi, gunakan seri A3 Edge.

Seri A3 (Tinggi dengan 1, 2, atau 4 GPU dan Edge)

A3 Tinggi (1, 2, atau 4 GPU)

Jika Anda menjalankan inferensi atau workload pelatihan standar yang memerlukan performa tinggi, tetapi tidak memerlukan cluster yang disinkronkan 8 GPU penuh, gunakan seri mesin A3 High dengan 1, 2, atau 4 GPU terpasang.

Jenis mesin A3 High memiliki GPU NVIDIA H100 SXM dan sangat cocok untuk inferensi model besar dan penyetelan lanjutan model.

GPU NVIDIA H100 terpasang
Jenis mesin Jumlah vCPU1 Memori instance (GB) SSD Lokal yang Terpasang (GiB) Jumlah NIC fisik Bandwidth jaringan maksimum (Gbps)2 Jumlah GPU Memori GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1.500 1 50 2 160
a3-highgpu-4g 104 936 3.000 1 100 4 320
a3-highgpu-8g 208 1.872 6.000 5 1.000 8 640

1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya. Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.

A3 Edge

Jika Anda menjalankan workload inferensi terdistribusi dengan throughput tinggi di beberapa host tanpa fabric cluster yang terkoordinasi, gunakan seri A3 Edge untuk menyederhanakan deployment melalui jaringan pribadi virtual standar.

Jenis mesin A3 Edge memiliki GPU NVIDIA H100 SXM dan dirancang khusus untuk inferensi dan tersedia di sejumlah region terbatas.

GPU NVIDIA H100 terpasang
Jenis mesin Jumlah vCPU1 Memori instance (GB) SSD Lokal yang Terpasang (GiB) Jumlah NIC fisik Bandwidth jaringan maksimum (Gbps)2 Jumlah GPU Memori GPU3
(GB HBM3)
a3-edgegpu-8g 208 1.872 6.000 5 8 640

Seri A2 (Standard dan Ultra)

Jika Anda perlu melakukan penayangan model satu node berperforma tinggi atau penyesuaian model skala kecil, gunakan seri mesin A2 untuk mengakses resource GPU NVIDIA A100 khusus.

A2 Ultra

GPU NVIDIA A100 80 GB terpasang
Jenis mesin Jumlah vCPU1 Memori instance (GB) SSD Lokal yang Terpasang (GiB) Bandwidth jaringan maksimum (Gbps)2 Jumlah GPU Memori GPU3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1.500 50 4 320
a2-ultragpu-8g 96 1.360 3.000 100 8 640

1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya. Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.

A2 Standard

GPU NVIDIA A100 40 GB terpasang
Jenis mesin Jumlah vCPU1 Memori instance (GB) SSD lokal didukung Bandwidth jaringan maksimum (Gbps)2 Jumlah GPU Memori GPU3
(GB HBM2)
a2-highgpu-1g 12 85 Ya 24 1 40
a2-highgpu-2g 24 170 Ya 32 2 80
a2-highgpu-4g 48 340 Ya 50 4 160
a2-highgpu-8g 96 680 Ya 100 8 320
a2-megagpu-16g 96 1.360 Ya 100 16 640

1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya. Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.

Seri G4

Jika tim Anda memerlukan inferensi tingkat entri yang hemat biaya atau workload rendering grafis standar, gunakan seri mesin G4 yang dilengkapi GPU NVIDIA RTX PRO 6000.

Jenis mesin G4 menggunakan GPU NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000) dan cocok untuk workload simulasi NVIDIA Omniverse, aplikasi yang intensif secara grafis, transkode video, dan desktop virtual. Jenis mesin G4 juga memberikan solusi berbiaya rendah untuk melakukan inferensi host tunggal dan penyesuaian model dibandingkan dengan jenis mesin seri A.

GPU NVIDIA RTX PRO 6000 terpasang
Jenis mesin Jumlah vCPU1 Memori instance (GB) SSD Titanium maksimum yang didukung (GiB)2 Jumlah NIC fisik Bandwidth jaringan maksimum (Gbps)3 Jumlah GPU Memori GPU4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1.500 1 50 1 96
g4-standard-96 96 360 3.000 1 100 2 192
g4-standard-192 192 720 6.000 1 200 4 384
g4-standard-384 384 1.440 12.000 2 400 8 768

*Memori GPU adalah memori yang tersedia di perangkat GPU yang dapat digunakan untuk penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload yang dipercepat seperti machine learning dan workload yang intensif secara grafis.

Seri G2

Jika Anda men-deploy aplikasi inferensi real-time mainstream atau pipeline Retrieval-Augmented Generation (RAG), gunakan seri mesin G2 untuk menyeimbangkan efisiensi performa dan biaya dengan GPU NVIDIA L4.

GPU NVIDIA L4 terpasang
Jenis mesin Jumlah vCPU1 Memori instance default (GB) Rentang memori instance kustom (GB) SSD Lokal maksimum yang didukung (GiB) Bandwidth jaringan maksimum (Gbps)2 Jumlah GPU Memori GPU3 (GB GDDR6)
g2-standard-4 4 16 16 hingga 32 375 10 1 24
g2-standard-8 8 32 32 hingga 54 375 16 1 24
g2-standard-12 12 48 48 hingga 54 tahun 375 16 1 24
g2-standard-16 16 64 54 hingga 64 375 32 1 24
g2-standard-24 24 96 96 hingga 108 750 32 2 48
g2-standard-32 32 128 96 hingga 128 375 32 1 24
g2-standard-48 48 192 192 hingga 216 1.500 50 4 96
g2-standard-96 96 384 384 hingga 432 3.000 100 8 192

1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya. Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.

Seri N1 (NVIDIA T4 atau V100)

Jika prioritas Anda adalah eksperimen yang sensitif terhadap biaya atau menjalankan inferensi tingkat entri dengan konkurensi rendah, gunakan seri mesin N1 untuk melampirkan GPU NVIDIA T4 atau V100.

NVIDIA T4

Jenis akselerator Jumlah GPU Memori GPU1 (GB GDDR6) Jumlah vCPU Memori instance (GB) SSD lokal didukung
nvidia-tesla-t4 atau
nvidia-tesla-t4-vws
1 16 1 hingga 48 1 hingga 312 Ya
2 32 1 hingga 48 1 hingga 312 Ya
4 64 1 hingga 96 1 hingga 624 Ya

NVIDIA V100

Jenis akselerator Jumlah GPU Memori GPU1 (GB HBM2) Jumlah vCPU Memori instance (GB) SSD Lokal didukung2
nvidia-tesla-v100 1 16 1 hingga 12 1 hingga 78 Ya
2 32 1 hingga 24 1 hingga 156 Ya
4 64 1 hingga 48 1 hingga 312 Ya
8 128 1 hingga 96 1 hingga 624 Ya

Akuisisi kapasitas

Akselerator GPU umum menggunakan penyediaan mandiri standar. Anda dapat memperoleh kapasitas melalui reservasi standar, permintaan sesuai permintaan, atau Spot VM. Karena kapasitas sesuai permintaan dapat mengalami kehabisan stok, gunakan Spot VM atau Flex-start jika memungkinkan.

Langkah berikutnya