- Kolokasi sumber daya infrastruktur AI
- Penempatan sesuai topologi cluster
- Mode operasional cluster
- Penjadwalan dan kontrol pemeliharaan cluster
- Alat diagnostik dan pemantauan cluster
Sebagian besar kemampuan pengelolaan cluster hanya didukung untuk kapasitas terikat reservasi—infrastruktur yang menggunakan model penyediaan terikat reservasi, yang hanya mendukung jenis mesin GPU bercluster. Untuk kapasitas yang menggunakan model penyediaan lainnya, hanya kemampuan pengelolaan cluster berikut yang tersedia:
- Kolokasi sumber daya infrastruktur AI
- Penempatan sesuai topologi cluster
- Mengelola acara penyelenggara di seluruh instance
Kolokasi resource infrastruktur AI
Saat menggunakan GPU yang di-cluster, seperti A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), Anda dapat meminta mesin host yang disediakan Compute Engine sedekat mungkin. Mesin ini menawarkan fitur berikut:
Compute Engine menyediakan mesin sebagai blok resource.
A fabric jaringan machine learning (ML) dinamis menghubungkan mesin.
Pengaturan resource ini meminimalkan hop jaringan dan mengoptimalkan latensi jaringan terendah. Untuk men-deploy blok mesin yang dioptimalkan untuk akselerator yang dialokasikan secara padat oleh Compute Engine, Anda dapat menggunakan opsi berikut:
Resource harus dialokasikan secara padat satu sama lain saat Anda melakukan satu atau beberapa hal berikut:
Buat resource yang menggunakan Pemesanan untuk masa mendatang di AI Hypercomputer atau Pemesanan untuk masa mendatang dalam mode kalender.
Deploy grup instance terkelola (MIG) yang menggunakan permintaan perubahan ukuran dan buat resource dalam permintaan yang sama.
Tentukan bahwa resource menggunakan kebijakan penempatan rapat atau kebijakan workload yang sama yang menentukan nilai jarak maksimum. Secara khusus, resource hanya diperlukan untuk berada sedekat nilai jarak maksimum yang ditentukan kebijakan.
Resource dapat dialokasikan secara padat satu sama lain berdasarkan ketersediaan terbaik, jika Anda melakukan satu atau beberapa hal berikut:
Buat resource dalam permintaan yang sama untuk VM mulai fleksibel.
Tentukan bahwa resource menggunakan kebijakan penempatan rapat atau kebijakan workload yang sama yang tidak menentukan jarak maksimum.
Penempatan sesuai topologi cluster
Setelah membuat GPU berkluster, Anda bisa mendapatkan informasi topologi di tingkat node dan cluster. Informasi ini membantu Anda melakukan hal berikut:
Sesuaikan desain aplikasi atau workload Anda untuk makin meminimalkan latensi jaringan.
Memahami dan memecahkan masalah latensi jaringan dan performa untuk instance yang sering berkomunikasi satu sama lain. Masalah ini dapat terjadi jika instance ditempatkan terlalu jauh secara tidak terduga.
Secara khusus, informasi topologi didukung sebagai berikut:
Informasi topologi berfungsi paling baik dengan kapasitas terikat reservasi, yang diperlukan untuk melihat topologi reservasi.
Untuk Spot VM, informasi topologi hanya muncul saat mesin menggunakan kebijakan penempatan rapat atau kebijakan workload.
Untuk informasi selengkapnya, lihat referensi berikut:
- Untuk instance dan cluster Slurm, lihat Melihat topologi instance komputasi.
- Untuk cluster GKE, lihat Melihat topologi node GKE dan Menjadwalkan workload GKE dengan Topology Aware Scheduling (TAS).
Mode operasional cluster
Saat Anda memesan kapasitas terikat reservasi untuk membuat instance atau cluster komputasi, jenis mesin yang Anda pesan akan menentukan mode operasional cluster untuk instance. Mode ini menentukan perilaku instance Anda setelah terjadi error host atau laporan host yang rusak. Mode operasional yang tersedia untuk instance adalah mode terkelola, di mana Compute Engine secara otomatis mengganti mesin yang rusak, tetapi menahan sebagian kapasitas yang dipesan untuk memastikan instance Anda memiliki resource yang diperlukan untuk memulai ulang. Atau mode semua kapasitas, tempat Anda memiliki akses ke kapasitas yang dicadangkan penuh, tetapi bertanggung jawab untuk mengelola kegagalan dan pemeliharaan terencana.
Untuk mengetahui informasi selengkapnya, lihat Mode operasional pemesanan.
Penjadwalan dan kontrol pemeliharaan cluster
Anda mengontrol pemeliharaan GPU yang dikelompokkan dengan menggunakan penjadwalan yang mengetahui topologi dalam blok resource. Kemampuan ini membantu menyinkronkan upgrade sehingga workload Anda lebih tahan terhadap peristiwa host dan meminimalkan gangguan. Pendekatan ini membantu meningkatkan goodput beban kerja Anda.
Untuk memfasilitasi kontrol penuh atas peristiwa pemeliharaan, Anda dapat menggunakan fitur berikut:
Jenis penjadwalan pemeliharaan
Saat memesan kapasitas terikat reservasi untuk membuat instance komputasi atau cluster GPU yang dikelompokkan, Anda dapat menentukan cara Compute Engine mempertahankan infrastruktur tempat instance Anda berjalan. Berdasarkan jenis mesin yang ingin Anda gunakan untuk instance, Anda dapat memilih antara pemeliharaan yang disinkronkan di seluruh instance (dikelompokkan), atau jadwal pemeliharaan yang berbeda (independen).
Untuk mengetahui informasi selengkapnya, lihat Jenis penjadwalan pemeliharaan.
Mengelola acara host
Setelah membuat GPU berkluster dan memulai workload, Anda dapat menyiapkan pemberitahuan dan menerima notifikasi saat pemeliharaan untuk instance atau blok yang dicadangkan dijadwalkan, dimulai, atau selesai. Anda juga dapat melihat dan, jika perlu, memulai pemeliharaan secara manual pada instance atau blok yang dicadangkan sebelum waktu yang dijadwalkan. Opsi ini membantu Anda mengontrol dan meminimalkan periode nonaktif pada workload secara proaktif.
Untuk informasi selengkapnya, lihat referensi berikut:
Alat diagnostik dan pemantauan cluster
Untuk pemantauan dan pemecahan masalah, jenis mesin GPU bercluster mencakup layanan berikut untuk kapasitas yang terikat reservasi:
Prediksi penurunan kualitas VM, yang membantu Anda mengidentifikasi VM yang kemungkinan akan mengalami penurunan kualitas dalam lima jam berikutnya.
Pelaporan host yang bermasalah, yang dapat Anda gunakan untuk menandai masalah pada masing-masing mesin host.
Dukungan untuk metrik Cloud Monitoring, yang membantu Anda memantau performa jaringan dan GPU.