Layanan jaringan yang Anda konfigurasi bergantung pada opsi deployment (VM atau cluster) dan infrastruktur yang Anda pilih.
Dokumen ini ditujukan untuk arsitek, engineer jaringan, dan developer yang ingin memahami layanan jaringan untuk deployment AI Hypercomputer mereka. Dokumen ini mengasumsikan bahwa Anda memiliki pemahaman dasar tentang konsep jaringan cloud dan komputasi terdistribusi. Untuk mengetahui informasi selengkapnya tentang opsi deployment, lihat Ringkasan opsi deployment.
Untuk mengetahui informasi mendetail tentang arsitektur jaringan, protokol, dan hardware topologi, lihat Ringkasan jaringan GPU overview.
Jaringan untuk deployment GKE yang dioptimalkan AI dengan konfigurasi default
Saat Anda membuat cluster GKE yang dioptimalkan AI dengan setelan default, blueprint Cluster Toolkit akan mengonfigurasi jaringan sebagai berikut:
- Blueprint menggunakan jaringan VPC default untuk cluster GKE utama.
- Blueprint membuat dua VPC tambahan: satu untuk Kartu Antarmuka Jaringan (NIC) host kedua dan satu lagi untuk traffic akses memori langsung jarak jauh (RDMA) GPU-ke-GPU.
- Blueprint menerapkan profil jaringan yang dikelola Google dan telah dikonfigurasi sebelumnya ke VPC yang digunakan untuk traffic GPU. Profil ini secara otomatis mengonfigurasi jaringan untuk performa RDMA berkecepatan tinggi dan berlatensi rendah.
- Blueprint secara otomatis membuat delapan subnet khusus di dalam VPC RDMA, satu untuk setiap NIC RDMA di VM akselerator.
- Blueprint mengonfigurasi aturan firewall yang mengizinkan semua traffic TCP, UDP, dan ICMP antar-node dalam cluster.
Jaringan untuk deployment GKE dengan konfigurasi kustom
Konfigurasi jaringan untuk penyiapan GKE kustom bergantung pada jenis workload dan infrastruktur Anda:
- Untuk GPU Umum atau workload non-terdistribusi, buat cluster GKE tanpa GPUDirect RDMA. Konfigurasi ini menggunakan jaringan VPC tunggal untuk semua komunikasi.
- Untuk GPU Bercluster atau workload terdistribusi, buat cluster GKE dengan GPUDirect RDMA diaktifkan. Konfigurasi ini menggunakan lingkungan multi-VPC yang memisahkan traffic tujuan umum dari komunikasi GPU-ke-GPU ber-bandwidth tinggi.
Jaringan untuk deployment cluster Slurm
Gunakan Cluster Toolkit untuk men-deploy workload AI dan ML melalui blueprint yang dapat disesuaikan, seperti untuk seri A4 atau A3 Ultra.
Komponen jaringan yang dikonfigurasi oleh blueprint untuk deployment Slurm GPU Bercluster adalah sebagai berikut:
- Blueprint membuat tiga VPC yang berbeda: VPC utama untuk bidang kontrol Slurm, VPC sekunder untuk traffic tingkat host umum, dan VPC berperforma tinggi khusus untuk komunikasi GPU-ke-GPU.
- Untuk bidang data GPU, blueprint menerapkan profil jaringan yang dikelola Google dan telah dikonfigurasi sebelumnya yang dioptimalkan untuk RoCE.
- Blueprint menetapkan rentang alamat IP khusus yang diperlukan oleh layanan Filestore, yang menyediakan direktori
/homebersama untuk cluster. - Blueprint membuat VPC build image sementara dan terisolasi yang hanya digunakan selama proses pembuatan image VM kustom untuk node cluster.
Jaringan untuk instance Compute Engine
Anda dapat menggunakan Compute Engine untuk membuat VM mandiri, instance komputasi massal, dan grup instance terkelola (MIG). Persyaratan jaringan tertentu bergantung pada model infrastruktur jenis mesin:
- GPU Bercluster: seri mesin ini (A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High dengan 8 GPU) memerlukan konfigurasi jaringan multi-VPC untuk memisahkan traffic host-ke-host umum dari komunikasi GPU-ke-GPU ber-bandwidth tinggi.
- GPU Umum: seri mesin ini (G2, G4, A2, dan N1 dengan T4 atau V100) menggunakan arsitektur VPC tunggal melalui antarmuka gVNIC untuk semua komunikasi. A3 Edge adalah pengecualian yang memerlukan empat VPC data dan GPUDirect-TCPX.
Untuk mengetahui informasi mendetail tentang NIC dan konfigurasi jaringan untuk jenis mesin Anda, lihat Jaringan dan mesin GPU.
Langkah berikutnya
- Untuk mempelajari praktik terbaik dalam membuat lingkungan jaringan yang aman dan tangguh, lihat Praktik terbaik jaringan.
- Untuk mempelajari opsi penyimpanan di AI Hypercomputer, lihat Tentang layanan penyimpanan untuk workload AI dan ML.
- Untuk melakukan orientasi ke deployment cluster, lihat Merencanakan dan membuat infrastruktur AI Anda.