Gunakan dokumen ini untuk mengidentifikasi infrastruktur akselerator yang optimal untuk workload kecerdasan buatan (AI) dan machine learning (ML) berdasarkan tahap siklus proses Anda, seperti pembuatan prototipe skala kecil, inferensi real-time, dan pelatihan terdistribusi berskala besar. AI Hypercomputer mengatur penawaran akselerator ke dalam dua kategori: GPU umum dan GPU bercluster.
Infrastruktur GPU
AI Hypercomputer menawarkan dua kategori GPU yang berbeda. Setiap kategori memiliki model pengelolaan yang berbeda yang menentukan cara sistem menangani peristiwa siklus proses, mengelola pemeliharaan, dan mengoptimalkan jaringan untuk workload Anda:
Model pengelolaan GPU umum
Model pengelolaan GPU umum dirancang untuk workload yang memprioritaskan independensi resource dan ketersediaan tinggi. Model ini menggunakan bidang pengelolaan standar Google Cloud , yang memberikan pengalaman yang familiar bagi tim yang sudah menggunakan Compute Engine atau GKE.
Pemeliharaan: asinkron. Setiap instance diupdate secara independen. Dalam fleet inferensi multinode, peristiwa pemeliharaan pada satu node tidak memengaruhi ketersediaan node lainnya, sehingga traffic dapat dialihkan ke node yang responsif tanpa menghentikan seluruh tugas.
Kasus penggunaan utama: direkomendasikan untuk tugas utama seperti inferensi real-time, penyajian model, pembuatan prototipe skala kecil, dan lingkungan pengembangan yang tidak memerlukan skala superkomputer.
Seri mesin GPU umum
Seri mesin berikut adalah GPU umum:
- G2 (L4)
- G4 (RTX PRO 6000)
- A2 (A100)
- N1+T4
- A3 Edge
- A3 High (1, 2, atau 4 GPU)
Untuk informasi teknis tentang setiap mesin GPU umum, lihat Jenis mesin GPU.
Model pengelolaan GPU bercluster
Model pengelolaan GPU bercluster adalah lingkungan kelas superkomputer yang direkayasa untuk pelatihan terdistribusi berskala besar. Resource dikelola sebagai sistem tunggal yang terhubung erat menggunakan tumpukan GPU bercluster.
Pemeliharaan: terkoordinasi. Model ini mengoordinasikan peristiwa pemeliharaan untuk mendukung workload yang terhubung erat. Untuk pelatihan terdistribusi, Anda dapat menggunakan pemeliharaan yang disinkronkan, dengan update diterapkan di semua node secara bersamaan. Pendekatan ini mencegah node dimulai ulang dari tugas yang terhenti dan memaksimalkan goodput. Model ini juga menawarkan notifikasi pemeliharaan 90 hari.
Kasus penggunaan utama: dirancang untuk melatih model dasar eksaskala dengan triliunan parameter atau menjalankan simulasi komputasi berperforma tinggi (HPC) yang kompleks, seperti penemuan obat dan pelipatan protein.
Seri mesin GPU bercluster
Seri mesin berikut adalah GPU bercluster:
- A4X
- A4 (Blackwell)
- A3 Ultra
- A3 Mega
- A3 High (8 GPU)
Untuk informasi teknis tentang setiap mesin GPU bercluster, lihat Jenis mesin GPU.
Matriks kemampuan
Bandingkan karakteristik teknis dan operasional model pengelolaan GPU umum dan GPU bercluster:
| Karakteristik | Model pengelolaan GPU umum | Model pengelolaan GPU bercluster |
|---|---|---|
| Kasus penggunaan utama | Inferensi, penyajian model, pembuatan prototipe, dan pengembangan | Pelatihan terdistribusi berskala besar dan HPC |
| Pemeliharaan | Asinkron: Update node independen memungkinkan traffic dialihkan tanpa menghentikan tugas | Terkoordinasi: Mendukung update terkoordinasi (tersinkronisasi) di seluruh cluster untuk menjaga node tetap sinkron dan memaksimalkan goodput |
| Hardware target | G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge, dan A3 High (1, 2, atau 4 GPU) | A4X, A4 (Blackwell), A3 Ultra, A3 Mega, dan A3 High (8 GPU) |
| Jaringan | Jaringan VPC standar melalui antarmuka gVNIC (kecuali A3 Edge, yang menggunakan GPUDirect-TCPX melalui beberapa VPC) | Fabric latensi rendah khusus (RDMA, RoCE, TCPX, atau NVIDIA NVLink) |
| Tumpukan pengelolaan | Bidang standar Google Cloud (Compute Engine atau GKE) | Tumpukan pengelolaan khusus (misalnya, Cluster Director) |
| Keandalan | Perbaikan otomatis node standar dan waktu aktif tingkat pod | Suite Resource dan Pemulihan khusus |
Matriks keputusan
Gunakan matriks ini untuk mengidentifikasi kelompok hardware yang sesuai dengan tujuan workload spesifik Anda:
| Jika workload Anda melibatkan... | Infrastruktur GPU yang direkomendasikan | Seri mesin yang direkomendasikan |
|---|---|---|
| Pembuatan prototipe dan pengembangan | GPU umum | G2, G4, A2, N1+T4, A3 Edge |
| Inferensi real-time (< 100 miliar parameter) | GPU umum | G2, G4, A2, N1+T4, A3 Edge |
| Inferensi di beberapa GPU | GPU bercluster | A3, A4 |
| Pelatihan dan inferensi berskala besar | GPU bercluster | Seri A4, A3 |
| Pelatihan berskala besar (> 500 miliar parameter) dan inferensi yang tidak digabungkan | GPU bercluster | A4X Max, A4X, A4 |
Untuk mengetahui diagram alur keputusan mendetail yang memetakan arsitektur model langsung ke hardware, lihat Memilih akselerator.
Setelah menetapkan kriteria utama ini, pilih platform orkestrasi. Pilihan ini bergantung pada preferensi tim Anda untuk pengelolaan otomatis atau kontrol terperinci atas sistem operasi dan driver.
Langkah berikutnya
- Untuk memilih orchestrator dan opsi deployment, lihat Memilih orchestrator dan opsi deployment.
- Untuk men-deploy workload inferensi atau menjalankan pelatihan berskala besar, lihat Tutorial AI Hypercomputer.
- Untuk mengoptimalkan efisiensi sistem, lihat Resep pengoptimalan goodput.