Memilih infrastruktur akselerator

Gunakan dokumen ini untuk mengidentifikasi infrastruktur akselerator yang optimal untuk workload kecerdasan buatan (AI) dan machine learning (ML) Anda berdasarkan tahap siklus proses Anda, seperti pembuatan prototipe skala kecil, inferensi real-time, dan pelatihan terdistribusi besar-besaran. AI Hypercomputer mengatur penawaran akselerator ke dalam dua kategori: GPU umum dan GPU bercluster.

Infrastruktur GPU

AI Hypercomputer menawarkan dua kategori GPU yang berbeda. Setiap kategori memiliki model pengelolaan yang berbeda yang menentukan cara sistem menangani peristiwa siklus proses, mengelola pemeliharaan, dan mengoptimalkan jaringan untuk workload Anda:

Model pengelolaan GPU umum

Model pengelolaan GPU umum dirancang untuk workload yang memprioritaskan independensi resource dan ketersediaan tinggi. Model ini menggunakan bidang pengelolaan standar Google Cloud , sehingga memberikan pengalaman yang sudah dikenal bagi tim yang sudah menggunakan Compute Engine atau GKE.

  • Pemeliharaan: asinkron. Setiap instance diupdate secara terpisah. Dalam fleet penayangan multinode, peristiwa pemeliharaan di satu node tidak memengaruhi ketersediaan node lain, sehingga traffic dapat dialihkan ke node yang berfungsi tanpa menghentikan seluruh tugas.

  • Kasus penggunaan utama: direkomendasikan untuk tugas umum seperti inferensi real-time, penayangan model, pembuatan prototipe skala kecil, dan lingkungan pengembangan yang tidak memerlukan skala superkomputer.

Seri mesin GPU umum

Seri mesin berikut adalah GPU umum:

  • A3 Tinggi dengan 1, 2, atau 4 GPU
  • A3 Edge
  • A2
  • G4
  • G2
  • N1+T4
  • N1+V100

Untuk mengetahui informasi teknis tentang setiap mesin GPU umum, lihat Jenis mesin GPU.

Model pengelolaan GPU yang dikelompokkan

Model pengelolaan GPU bercluster adalah lingkungan kelas superkomputer yang dirancang untuk pelatihan terdistribusi skala besar. Resource dikelola sebagai sistem tunggal yang terintegrasi erat dengan menggunakan stack GPU yang dikelompokkan.

  • Pemeliharaan: terkoordinasi. Model ini mengoordinasikan peristiwa pemeliharaan untuk mendukung workload yang terhubung erat. Untuk pelatihan terdistribusi, Anda dapat menggunakan pemeliharaan yang disinkronkan, dengan update diterapkan di semua node secara bersamaan. Pendekatan ini mencegah restart node menghentikan pekerjaan dan memaksimalkan goodput. Model ini juga menawarkan notifikasi pemeliharaan 90 hari.

  • Kasus penggunaan utama: dirancang untuk melatih model dasar exascale dengan triliunan parameter atau menjalankan simulasi komputasi berperforma tinggi (HPC) yang kompleks, seperti penemuan obat dan pelipatan protein.

Seri mesin GPU yang dikelompokkan

Seri mesin berikut adalah GPU yang dikelompokkan:

  • A4X Max
  • A4X
  • A4
  • A3 Ultra
  • A3 Mega
  • A3 High dengan 8 GPU

Untuk mengetahui informasi teknis tentang setiap mesin GPU yang dikelompokkan, lihat Jenis mesin GPU.

Matriks kemampuan

Bandingkan karakteristik teknis dan operasional model pengelolaan GPU umum dan GPU berkluster:

Karakteristik Model pengelolaan GPU umum Model pengelolaan GPU yang dikelompokkan
Kasus penggunaan utama Inferensi, penyajian model, pembuatan prototipe, dan pengembangan Pelatihan terdistribusi berskala besar dan HPC
Pemeliharaan Asinkron: Update node independen memungkinkan traffic dialihkan tanpa menghentikan tugas Terkoordinasi: Mendukung update terkoordinasi (tersinkron) di seluruh cluster untuk menjaga agar node tetap sinkron dan memaksimalkan goodput
Hardware target A3 High (1, 2, atau 4 GPU), A3 Edge, G4, G2, A2, N1+T4, dan N1+V100 A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU)
Jaringan Jaringan VPC standar melalui antarmuka gVNIC (kecuali A3 Edge, yang menggunakan GPUDirect-TCPX melalui beberapa VPC) Kain latensi rendah khusus (RDMA, RoCE, TCPX, atau NVIDIA NVLink)
Stack pengelolaan Bidang Google Cloud standar (Compute Engine atau GKE) Stack pengelolaan khusus (misalnya, Cluster Director)
Keandalan Perbaikan otomatis node Standard dan waktu aktif tingkat pod Rangkaian Resource and Recovery khusus

Matriks keputusan

Gunakan matriks ini untuk mengidentifikasi kelompok hardware yang sesuai dengan maksud workload spesifik Anda:

Jika workload Anda melibatkan... Infrastruktur GPU yang direkomendasikan Seri mesin yang direkomendasikan
Pembuatan prototipe dan pengembangan GPU Umum A3 High (1, 2, atau 4 GPU), A3 Edge, A2, G4, G2, N1+T4, N1+V100
Inferensi real-time (< 100B parameter) GPU Umum A3 High (1, 2, atau 4 GPU), A3 Edge, A2, G4, G2, N1+T4, N1+V100
Inferensi di beberapa GPU GPU Bercluster A4, A3 Ultra, A3 Mega, A3 High (8 GPU)
Pelatihan dan inferensi berskala besar GPU Bercluster A4, A3 Ultra, A3 Mega, A3 High (8 GPU)
Pelatihan skala besar (> 500 miliar parameter) dan inferensi yang diuraikan GPU Bercluster A4X Max, A4X, A4

Untuk diagram alir keputusan mendetail yang memetakan arsitektur model langsung ke hardware, lihat Memilih akselerator.

Setelah menetapkan kriteria utama ini, pilih platform orkestrasi. Pilihan ini bergantung pada preferensi tim Anda untuk pengelolaan otomatis atau kontrol terperinci atas sistem operasi dan driver.

Langkah berikutnya