GPU yang dikelompokkan dioptimalkan untuk workload kecerdasan buatan (AI) dan machine learning (ML) yang memprioritaskan pelatihan terdistribusi skala besar, inferensi multi-host, dan tugas komputasi berperforma tinggi (HPC) yang kompleks.
GPU yang dikelompokkan memungkinkan tim men-deploy dan menskalakan ribuan akselerator yang saling terhubung sebagai satu sistem yang terhubung erat dengan menggunakan fabric jaringan khusus dan pemeliharaan yang disinkronkan. Kelompok mesin ini ideal untuk workload yang memerlukan komputasi ekstrem, memori, dan sinkronisasi jaringan berkecepatan tinggi. Kasus penggunaan umum mencakup pra-pelatihan model dasar dengan triliunan parameter, serving model mutakhir, dan simulasi untuk penemuan obat.
Karakteristik utama GPU Bercluster
- Pemeliharaan yang disinkronkan: Google Cloud memperbarui semua node dalam cluster secara bersamaan, sehingga mencegah satu tugas terhenti karena satu node dimulai ulang.
- Pemantauan kondisi otomatis: sistem secara proaktif mengidentifikasi instance yang lambat dan memantau kegagalan hardware atau kerusakan data yang tidak terdeteksi.
- Penggantian node proaktif: sistem mengeluarkan dan menjadwalkan ulang VM yang berperforma buruk di komputer yang berfungsi baik dari kumpulan cadangan.
- Topologi yang sesuai jalur: topologi yang sesuai jalur mengisolasi traffic GPU-ke-GPU dari komunikasi host standar untuk membantu memastikan performa bebas jitter untuk koordinasi multi-node yang besar.
- Protokol lanjutan: seri mesin ini mendukung interkoneksi bandwidth tinggi, termasuk GPUDirect RDMA (berdasarkan RoCE).
Kelompok GPU yang dikelompokkan dan spesifikasi teknis
Tinjau workload dan spesifikasi hardware untuk seri mesin GPU Berkelompok premium dalam tabel ini. Untuk pelatihan eksaskala, gunakan seri A4X atau A3 Ultra.
Seri A4X Max dan A4X
Jika Anda melatih model dasar eksaskala besar atau menjalankan simulasi komputasi berperforma tinggi (HPC) bare metal yang sangat kompleks, gunakan seri mesin A4X Max atau A4X. Seri ini dilengkapi dengan Superchip Ultra Grace Blackwell GB300 NVIDIA untuk menangani permintaan komputasi dan memori yang ekstrem.
A4X Max (Bare metal)
Jenis mesin A4X Max
menggunakan Superchip Ultra Grace Blackwell GB300 NVIDIA (nvidia-gb300) dan
ideal untuk pelatihan dan inferensi model dasar. Jenis mesin A4X Max tersedia
sebagai instance bare metal.
A4X Max adalah platform exascale yang didasarkan pada NVIDIA GB300 NVL72. Setiap mesin memiliki dua soket dengan CPU NVIDIA Grace dengan core Arm Neoverse V2. CPU ini terhubung ke empat GPU NVIDIA B300 Blackwell dengan komunikasi chip-ke-chip (NVLink-C2C) yang cepat.
| NVIDIA GB300 Grace Blackwell Ultra Superchips terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12.000 | 6 | 3.600 | 4 | 1.116 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
A4X
Jenis mesin A4X
menggunakan Superchip Grace Blackwell GB200 NVIDIA (nvidia-gb200) dan
ideal untuk pelatihan model dan inferensi.
A4X adalah platform exascale yang didasarkan pada NVIDIA GB200 NVL72. Setiap mesin memiliki dua soket dengan CPU NVIDIA Grace dengan core Arm Neoverse V2. CPU ini terhubung ke empat GPU NVIDIA B200 Blackwell dengan komunikasi chip-ke-chip (NVLink-C2C) yang cepat.
| Chip Super NVIDIA GB200 Grace Blackwell terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12.000 | 6 | 2.000 | 4 | 744 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
Seri A4
Jika sasaran Anda adalah melatih model dasar canggih yang memerlukan skala pemrosesan paralel yang sangat besar, gunakan seri mesin A4 untuk mengoptimalkan waktu pemrosesan dan memaksimalkan throughput hardware.
Jenis mesin A4 memiliki
GPU NVIDIA B200 Blackwell
(nvidia-b200) yang terpasang dan ideal untuk pelatihan dan inferensi model dasar.
| GPU NVIDIA B200 Blackwell terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3.968 | 12.000 | 10 | 3.600 | 8 | 1.440 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat
Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
Seri A3 (Ultra, Mega, dan High dengan 8 GPU)
Jika Anda perlu menjalankan pelatihan terdistribusi berskala besar atau menayangkan model mutakhir di beberapa host dengan tabel set data besar, gunakan seri mesin A3 untuk meminimalkan latensi jaringan antar-host.
A3 Ultra
| GPU NVIDIA H200 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2.952 | 12.000 | 10 | 3.600 | 8 | 1128 |
A3 Mega
| GPU NVIDIA H100 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3) |
a3-megagpu-8g |
208 | 1.872 | 6.000 | 9 | 1.800 | 8 | 640 |
A3 Tinggi
| GPU NVIDIA H100 terpasang | |||||||
|---|---|---|---|---|---|---|---|
| Jenis mesin | Jumlah vCPU1 | Memori instance (GB) | SSD Lokal yang Terpasang (GiB) | Jumlah NIC fisik | Bandwidth jaringan maksimum (Gbps)2 | Jumlah GPU | Memori GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1.500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3.000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1.872 | 6.000 | 5 | 1.000 | 8 | 640 |
1vCPU diimplementasikan sebagai hardware hyper-thread tunggal di salah satu
platform CPU yang tersedia.
2Bandwidth traffic keluar maksimum tidak boleh melebihi jumlah yang diberikan. Bandwidth
traffic keluar yang sebenarnya bergantung pada alamat IP tujuan dan faktor lainnya.
Untuk mengetahui informasi selengkapnya tentang bandwidth jaringan, lihat Bandwidth jaringan.
3Memori GPU adalah memori pada perangkat GPU yang dapat digunakan untuk
penyimpanan data sementara. Memori ini terpisah dari memori instance dan dirancang khusus untuk menangani permintaan bandwidth yang lebih tinggi dari workload intensif grafis Anda.
Akuisisi kapasitas
Mendapatkan kapasitas komputasi untuk GPU Berkelompok memerlukan koordinasi untuk mengelola penawaran dan permintaan akselerator berperforma tinggi. Karena resource ini berlokasi secara fisik dalam fabric jaringan khusus, Anda harus memintanya melalui alur kerja terkelola.
Anda dapat memesan kapasitas melalui tim akun atau menggunakan pemesanan mendatang dan Dynamic Workload Scheduler.
Langkah berikutnya
- Untuk mempelajari cara mendapatkan kapasitas, lihat Opsi penggunaan.
- Untuk mengevaluasi persyaratan infrastruktur Anda, lihat Memilih infrastruktur.
- Untuk merencanakan topologi jaringan, lihat Persyaratan jaringan GPU untuk lingkungan berkluster.
- Untuk mencadangkan resource komputasi, lihat Mencadangkan kapasitas.