Memilih antara GPU umum dan GPU bercluster

Dokumen ini memberikan rekomendasi untuk akselerator, opsi penggunaan, dan alat deployment yang paling cocok untuk berbagai workload kecerdasan buatan (AI), machine learning (ML), dan komputasi berperforma tinggi (HPC). Gunakan dokumen ini untuk membantu Anda mengidentifikasi deployment terbaik untuk workload Anda.

Untuk mengetahui informasi dan rekomendasi tentang pilar infrastruktur untuk workload AI, ML, dan HPC, lihat dokumen berikut:

Ringkasan beban kerja

Arsitektur AI Hypercomputer mendukung kasus penggunaan berikut:

Workload Deskripsi Rekomendasi
Model dasar pra-pelatihan Hal ini melibatkan pembuatan model bahasa menggunakan set data yang besar. Hasil pelatihan awal model dasar adalah model baru yang bagus dalam melakukan tugas umum.
Model dikategorikan berdasarkan ukurannya sebagai berikut:
  • Model termutakhir: Model ML yang mencakup ratusan miliar hingga triliunan parameter atau lebih. Hal ini mencakup model bahasa besar (LLM) seperti Gemini.
  • Model besar: Model ML yang mencakup puluhan hingga ratusan miliar parameter atau lebih.
Lihat rekomendasi untuk model pra-pelatihan
Penyesuaian (fine-tuning) Proses ini melibatkan pengambilan model terlatih dan penyesuaiannya untuk melakukan tugas tertentu dengan menggunakan set data khusus atau teknik lainnya. Penyesuaian umumnya dilakukan pada model besar. Lihat rekomendasi untuk menjalankan fine-tuning model
Inferensi atau serving Proses ini melibatkan pengambilan model terlatih atau yang telah di-fine-tune dan menyediakannya agar dapat digunakan oleh pengguna atau aplikasi.
Workload inferensi dikategorikan berdasarkan ukuran model sebagai berikut:
  • Inferensi untuk model dasar di beberapa host: melakukan inferensi dengan model ML terlatih yang mencakup ratusan miliar hingga triliunan parameter atau lebih. Untuk beban kerja inferensi ini, beban komputasi dibagi di beberapa mesin host.
  • Inferensi model dasar host tunggal: melakukan inferensi dengan model ML terlatih yang mencakup puluhan hingga ratusan miliar parameter. Untuk beban kerja inferensi ini, beban komputasi terbatas pada satu mesin host.
  • Inferensi model besar: melakukan inferensi dengan model ML terlatih atau yang di-fine-tune yang mencakup puluhan hingga ratusan miliar parameter.
Lihat rekomendasi untuk inferensi
ML untuk model berukuran kecil atau sedang Hal ini melibatkan pelatihan dan penyajian model ML yang lebih kecil dalam ukuran dan kompleksitas, biasanya untuk tugas yang lebih khusus. Lihat rekomendasi ML untuk model berukuran kecil atau sedang
HPC Ini adalah praktik penggabungan resource komputasi untuk mendapatkan performa yang lebih besar daripada performa dari satu workstation, server, atau komputer. HPC digunakan untuk menyelesaikan masalah dalam riset akademis, sains, desain, simulasi, dan business intelligence. Lihat rekomendasi untuk HPC

Rekomendasi untuk model pra-pelatihan

Untuk melatih model dasar, cluster besar akselerator terus-menerus membaca data dalam volume besar. Akselerator ini menyesuaikan bobot melalui penerusan dan penerusan balik untuk belajar dari data. Tugas pelatihan ini berjalan selama berminggu-minggu atau bahkan berbulan-bulan dalam satu waktu.

Bagian berikut menguraikan akselerator dan opsi konsumsi yang kami rekomendasikan untuk digunakan dalam melakukan pra-pelatihan model dasar.

Akselerator yang direkomendasikan

Untuk melakukan pra-pelatihan model dasar di Google Cloud, sebaiknya gunakan jenis mesin yang dioptimalkan untuk akselerator A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), atau A3 High (NVIDIA H100 80 GB), dan gunakan orkestrator untuk men-deploy cluster.

Untuk men-deploy cluster akselerator ini, sebaiknya Anda juga menggunakan Cluster Director atau Cluster Toolkit. Untuk mengetahui informasi selengkapnya, lihat panduan deployment cluster yang sesuai untuk jenis mesin pilihan Anda dalam tabel berikut.

Beban kerja Rekomendasi Panduan deployment cluster
Jenis mesin Orkestrator
Model dasar pra-pelatihan
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Membuat cluster GKE yang dioptimalkan untuk AI dengan konfigurasi default
Slurm
Pelatihan model besar A3 Ultra (NVIDIA H200 141GB) GKE Membuat cluster GKE yang dioptimalkan untuk AI dengan konfigurasi default
Slurm
Pelatihan model besar
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE Memaksimalkan bandwidth jaringan GPU di cluster mode Standar
Slurm

Opsi pemakaian yang direkomendasikan

Untuk mendapatkan kepastian tinggi dalam memperoleh cluster akselerator berukuran besar, sebaiknya gunakan reservasi. Secara khusus, untuk meminimalkan biaya resource yang dicadangkan, sebaiknya minta durasi reservasi yang cukup lama untuk menerima diskon penggunaan abonemen. Untuk mengetahui informasi selengkapnya tentang opsi pemakaian, lihat Memilih opsi pemakaian.

Rekomendasi untuk melakukan fine-tuning model

Untuk menyesuaikan model dasar besar, cluster akselerator yang lebih kecil membaca volume data sedang. Akselerator ini menyesuaikan model untuk melakukan tugas tertentu. Tugas penyesuaian ini berjalan selama berhari-hari atau bahkan berminggu-minggu.

Bagian berikut menguraikan akselerator dan opsi konsumsi yang direkomendasikan untuk digunakan saat melakukan penyesuaian model.

Untuk menyetel model secara halus di Google Cloud, sebaiknya gunakan jenis mesin yang dioptimalkan akselerator A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), atau A3 High (NVIDIA H100 80 GB), dan gunakan orkestrator untuk men-deploy cluster.

Untuk men-deploy cluster akselerator ini, sebaiknya Anda juga menggunakan Cluster Director atau Cluster Toolkit. Untuk mengetahui informasi selengkapnya, lihat panduan deployment cluster yang sesuai untuk jenis mesin pilihan Anda dalam tabel berikut.

Beban kerja Rekomendasi Panduan deployment cluster
Jenis mesin Orkestrator
Menyesuaikan model besar A3 Ultra (NVIDIA H200 141GB) GKE Membuat cluster GKE yang dioptimalkan untuk AI dengan konfigurasi default
Slurm
Menyesuaikan model besar
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE Memaksimalkan bandwidth jaringan GPU di cluster mode Standar
Slurm

Opsi pemakaian yang direkomendasikan

Untuk workload fine-tuning, gunakan pemesanan untuk masa mendatang dalam mode kalender untuk menyediakan resource. Untuk mengetahui informasi selengkapnya tentang opsi pemakaian, lihat Memilih opsi pemakaian.

Rekomendasi untuk inferensi

Bagian berikut menguraikan akselerator dan opsi konsumsi yang direkomendasikan untuk digunakan saat melakukan inferensi.

Akselerator yang direkomendasikan

Akselerator yang direkomendasikan untuk inferensi bergantung pada apakah Anda melakukan inferensi model besar atau inferensi frontier multi-host, atau inferensi frontier host tunggal.

Akselerator yang direkomendasikan (multi-host)

Untuk melakukan inferensi model besar atau model baru multi-host di Google Cloud, gunakan jenis mesin yang dioptimalkan untuk akselerator A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), atau A3 High (NVIDIA H100 80 GB), lalu deploy mesin menggunakan orkestrator. Untuk men-deploy cluster akselerator ini, sebaiknya Anda juga menggunakan Cluster Director atau Cluster Toolkit. Tabel ini menyediakan link ke panduan deployment cluster untuk setiap jenis mesin yang direkomendasikan.

Beban kerja Rekomendasi Panduan deployment cluster
Jenis mesin Orkestrator
Inferensi frontier multi-host
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Membuat cluster GKE yang dioptimalkan untuk AI dengan konfigurasi default
Slurm
Inferensi model besar A3 Ultra (NVIDIA H200 141GB) GKE Membuat cluster GKE yang dioptimalkan untuk AI dengan konfigurasi default
Slurm
Inferensi model besar
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE Memaksimalkan bandwidth jaringan GPU di cluster mode Standar
Slurm

Akselerator yang direkomendasikan (host tunggal)

Tabel ini menguraikan akselerator yang sebaiknya Anda gunakan untuk melakukan inferensi frontier host tunggal. Tabel ini menyediakan link ke panduan deployment VM untuk setiap jenis mesin yang direkomendasikan.

Beban kerja Rekomendasi Panduan deployment VM
Jenis mesin Orkestrator
Inferensi mainstream dan frontier satu host
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141GB)
T/A Membuat instance A4 atau A3 Ultra
  • A3 High (NVIDIA H100 80GB)
  • A3 Edge (NVIDIA H100 80GB)
Membuat instance A3 High atau A3 Edge
G4 (NVIDIA RTX PRO 6000) Membuat instance G4
A2 (NVIDIA A100) Membuat instance A2
G2 (NVIDIA L4) Membuat instance G2
N1 (NVIDIA T4 atau V100) Buat instance N1

Opsi pemakaian yang direkomendasikan

Untuk inferensi, gunakan pemesanan yang berjalan lama atau pemesanan untuk masa mendatang dalam mode kalender. Untuk mengetahui informasi selengkapnya tentang opsi pemakaian, lihat Memilih opsi pemakaian.

Rekomendasi untuk model berukuran kecil atau sedang

Untuk beban kerja ML yang melibatkan model berukuran kecil hingga sedang, mencapai keseimbangan yang optimal antara harga dan performa adalah pertimbangan utama.

Akselerator yang direkomendasikan

Tabel berikut menguraikan akselerator yang direkomendasikan untuk digunakan pada workload ML model berukuran kecil hingga sedang.

Beban kerja Rekomendasi Panduan deployment VM
Jenis mesin Orkestrator
ML untuk model berukuran kecil atau sedang G4 (NVIDIA RTX PRO 6000) T/A Membuat instance G4
G2 (NVIDIA L4) Membuat instance G2
A2 (NVIDIA A100) Membuat instance A2
A3 Edge (NVIDIA H100 80GB) Membuat instance A3 Edge
N1 (NVIDIA T4 atau V100) Buat instance N1

Rekomendasi untuk HPC

Untuk workload HPC, seri mesin yang dioptimalkan akselerator atau seri mesin yang dioptimalkan untuk komputasi akan berfungsi dengan baik. Jika menggunakan seri mesin yang dioptimalkan akselerator, kecocokan terbaik bergantung pada jumlah komputasi yang harus dialihkan ke GPU. Untuk daftar mendetail rekomendasi untuk workload HPC, lihat Praktik terbaik untuk menjalankan workload HPC.

Ringkasan rekomendasi

Tabel berikut merangkum akselerator dan opsi penggunaan yang direkomendasikan untuk setiap workload.

Resource Rekomendasi
Pra-pelatihan model
Kelompok mesin Gunakan salah satu jenis mesin yang dioptimalkan untuk akselerator berikut: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), atau A3 High (NVIDIA H100 80 GB)
Opsi pemakaian 'Gunakan pemesanan standar untuk masa mendatang
Penyesuaian model
Kelompok mesin Gunakan jenis mesin yang dioptimalkan akselerator A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), atau A3 High (NVIDIA H100 80 GB)
Opsi pemakaian 'Gunakan pemesanan standar untuk masa mendatang
Inferensi
Kelompok mesin Gunakan salah satu jenis mesin berikut: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), A3 High (NVIDIA H100 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB), atau N1 (NVIDIA T4 atau V100)
Opsi pemakaian Menggunakan reservasi, on-demand, atau Spot
ML untuk model berukuran kecil atau sedang
Kelompok mesin Gunakan salah satu jenis mesin berikut: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB), atau N1 (NVIDIA T4 atau V100)
Opsi pemakaian Menggunakan reservasi on-demand, Spot, atau standar
Penyimpanan Menggunakan Cloud Storage FUSE
HPC
Lihat bagian ringkasan praktik terbaik untuk menjalankan workload HPC

Langkah berikutnya