GPU yang dikelompokkan, seperti seri mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), dirancang untuk memungkinkan Anda menjalankan cluster kecerdasan buatan (AI) dan machine learning (ML) berskala besar serta menyediakan kemampuan pengelolaan cluster berikut:
- Kolokasi infrastruktur GPU yang dikelompokkan
- Penempatan sesuai topologi cluster
- Mode operasional cluster
- Kontrol dan penjadwalan pemeliharaan cluster
- Alat diagnostik dan pemantauan cluster
Seri mesin yang didukung
Kemampuan pengelolaan cluster yang dijelaskan di halaman ini tersedia untuk seri mesin GPU yang Dikelompokkan , yang dioptimalkan untuk workload berskala besar dan multi-node.
Fitur ini tidak berlaku untuk seri mesin GPU Umum, yang terdiri dari resource komputasi independen yang menggunakan jaringan VPC standar dan tidak mendukung mode operasional pemeliharaan atau kolokasi padat.
Tabel berikut merangkum seri mesin yang didukung di AI Hypercomputer:
| Kategori | Seri mesin | Mendukung pengelolaan cluster |
|---|---|---|
| GPU yang dikelompokkan | A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High | Ya |
| GPU umum | A3 Edge, A2, G2, G4, N1 | Tidak |
Untuk mengetahui informasi selengkapnya tentang setiap seri mesin, lihat Tentang akselerator GPU.
Sebagian besar kemampuan pengelolaan cluster hanya didukung untuk kapasitas terikat pemesanan—infrastruktur yang menggunakan model penyediaan terikat pemesanan, yang hanya mendukung jenis mesin GPU yang dikelompokkan. Untuk kapasitas yang menggunakan model penyediaan lainnya, hanya kemampuan pengelolaan cluster berikut yang tersedia:
- Kolokasi resource infrastruktur AI
- Penempatan sesuai topologi cluster
- Mengelola peristiwa host di seluruh instance
Kolokasi infrastruktur GPU yang dikelompokkan
Saat menggunakan GPU yang dikelompokkan, seperti A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), Anda dapat meminta mesin host yang disediakan Compute Engine sedekat mungkin. Mesin ini menawarkan fitur berikut:
Compute Engine menyediakan mesin sebagai blok resource.
Pengaturan resource ini meminimalkan hop jaringan dan mengoptimalkan latensi jaringan terendah. Untuk men-deploy blok mesin yang dioptimalkan akselerator yang dialokasikan Compute Engine secara padat, Anda dapat menggunakan opsi berikut:
Resource harus dialokasikan secara padat satu sama lain saat Anda melakukan satu atau beberapa hal berikut:
Membuat resource yang menggunakan Pemesanan untuk masa mendatang di AI Hypercomputer atau Pemesanan untuk masa mendatang dalam mode kalender.
Men-deploy grup instance terkelola (MIG) yang menggunakan permintaan perubahan ukuran dan membuat resource dalam permintaan yang sama.
Menentukan bahwa resource menggunakan kebijakan penempatan rapat atau kebijakan workload yang sama yang menentukan nilai jarak maksimum. Secara khusus, resource hanya perlu sedekat nilai jarak maksimum yang ditentukan kebijakan.
Resource secara opsional dialokasikan secara padat satu sama lain, berdasarkan ketersediaan upaya terbaik, saat Anda melakukan satu atau beberapa hal berikut:
Membuat resource dalam permintaan yang sama untuk VM Flex-start.
Menentukan bahwa resource menggunakan kebijakan penempatan rapat atau kebijakan workload yang sama yang tidak menentukan jarak maksimum.
Penempatan sesuai topologi cluster
Setelah membuat GPU yang dikelompokkan, Anda bisa mendapatkan informasi topologi di tingkat node dan cluster. Informasi ini membantu Anda melakukan hal berikut:
Menyesuaikan desain aplikasi atau workload untuk makin meminimalkan latensi jaringan.
Memahami dan memecahkan masalah latensi jaringan dan performa untuk instance yang sering berkomunikasi satu sama lain. Masalah ini dapat terjadi jika instance ditempatkan berjauhan secara tidak terduga.
Secara khusus, dukungan untuk kemampuan topologi adalah sebagai berikut:
Informasi topologi berfungsi paling baik dengan kapasitas terikat pemesanan, yang diperlukan untuk melihat topologi pemesanan.
Kemampuan topologi hanya mendukung jenis mesin yang mendukung kebijakan penempatan rapat.
Untuk VM Spot, informasi topologi hanya muncul saat mesin menggunakan kebijakan penempatan rapat.
Untuk mengetahui informasi selengkapnya, lihat Melihat topologi instance komputasi.
Mode operasional cluster
Saat Anda memesan kapasitas untuk membuat instance komputasi atau cluster menggunakan GPU yang dikelompokkan, jenis mesin yang Anda pesan akan menentukan mode operasional cluster untuk instance. Mode ini menentukan perilaku instance Anda setelah error host atau laporan host yang salah. Mode operasional yang tersedia untuk instance adalah mode terkelola, tempat Compute Engine secara otomatis mengganti mesin yang rusak, tetapi menahan sebagian kapasitas yang Anda pesan untuk memastikan instance Anda memiliki resource yang diperlukan untuk memulai ulang. Atau mode semua kapasitas, tempat Anda memiliki akses ke kapasitas yang dipesan secara penuh, tetapi bertanggung jawab untuk mengelola kegagalan dan pemeliharaan yang direncanakan.
Untuk mengetahui informasi selengkapnya, lihat Mode operasional pemesanan.
Kontrol dan penjadwalan pemeliharaan cluster
Anda mengontrol pemeliharaan GPU yang dikelompokkan menggunakan penjadwalan sesuai topologi dalam blok resource. Kemampuan ini membantu menyinkronkan upgrade sehingga workload Anda lebih tahan terhadap peristiwa host dan meminimalkan gangguan. Pendekatan ini membantu meningkatkan goodput workload Anda.
Untuk memfasilitasi kontrol penuh atas peristiwa pemeliharaan, Anda dapat menggunakan fitur berikut:
Jenis penjadwalan pemeliharaan
Saat Anda memesan kapasitas untuk membuat instance komputasi atau cluster GPU yang dikelompokkan, Anda dapat menentukan cara Compute Engine memelihara infrastruktur tempat instance Anda berjalan. Berdasarkan jenis mesin yang ingin Anda gunakan untuk instance, Anda dapat memilih antara pemeliharaan yang disinkronkan di seluruh instance (dikelompokkan), atau jadwal pemeliharaan yang berbeda (independen).
Untuk mengetahui informasi selengkapnya, lihat Jenis penjadwalan pemeliharaan.
Mengelola peristiwa host
Setelah membuat GPU yang dikelompokkan dan memulai workload, Anda dapat menyiapkan pemberitahuan dan menerima notifikasi saat pemeliharaan untuk instance atau blok yang dipesan dijadwalkan, dimulai, atau selesai. Anda juga dapat melihat dan, jika diperlukan, memulai pemeliharaan secara manual pada instance atau blok yang dipesan sebelum waktu yang dijadwalkan. Opsi ini membantu Anda mengontrol dan meminimalkan waktu nonaktif workload secara proaktif.
Untuk informasi selengkapnya, lihat referensi berikut:
Alat diagnostik dan pemantauan cluster
Untuk pemantauan dan pemecahan masalah, GPU yang dikelompokkan mencakup layanan berikut:
Prediksi penurunan kualitas VM, yang membantu Anda mengidentifikasi VM yang kemungkinan akan mengalami penurunan kualitas dalam lima jam ke depan.
Pelaporan host yang salah, yang dapat Anda gunakan untuk menandai masalah pada mesin host individual.
Dukungan untuk metrik Cloud Monitoring, yang membantu Anda memantau performa jaringan dan GPU.