Die von Ihnen konfigurierten Netzwerkdienste hängen von der ausgewählten Bereitstellungsoption (VMs oder Cluster) und der Infrastruktur ab.
Dieses Dokument richtet sich an Architekten, Netzwerktechniker und Entwickler, die mehr über die Netzwerkdienste für ihre AI Hypercomputer-Bereitstellungen erfahren möchten. Dabei wird vorausgesetzt, dass Sie mit Cloud-Netzwerken und verteilten Computing-Konzepten vertraut sind. Weitere Informationen zu Bereitstellungsoptionen, siehe Übersicht über Bereitstellungsoptionen.
Detaillierte Informationen zu Netzwerkarchitektur, Protokollen und Hardware topologien finden Sie in der Übersicht zu GPU-Netzwerken.
Netzwerk für KI-optimierte GKE-Bereitstellungen mit Standardkonfigurationen
Wenn Sie einen KI-optimierten GKE-Cluster mit Standardeinstellungen erstellen, konfiguriert der Cluster Toolkit-Blueprint das Netzwerk so:
- Der Blueprint verwendet das Standard-VPC-Netzwerk für den Haupt-GKE-Cluster.
- Er erstellt zwei zusätzliche VPCs: eine für eine zweite Host-Netzwerkkarte (Network Interface Card, NIC) und eine weitere für den GPU-zu-GPU-Traffic für den Remote Direct Memory Access (RDMA).
- Der Blueprint wendet ein vorkonfiguriertes, von Google verwaltetes Netzwerkprofil auf die VPC an, die für den GPU-Traffic verwendet wird. Dieses Profil konfiguriert das Netzwerk automatisch für eine schnelle RDMA-Leistung mit niedriger Latenz.
- Der Blueprint erstellt automatisch acht dedizierte Subnetze innerhalb der RDMA-VPC, eines für jede RDMA-NIC auf einer Beschleuniger-VM.
- Er konfiguriert Firewallregeln, die den gesamten TCP-, UDP- und ICMP-Traffic zwischen Knoten im Cluster zulassen.
Netzwerk für GKE-Bereitstellungen mit benutzerdefinierter Konfiguration
Die Netzwerkkonfiguration für benutzerdefinierte GKE-Einrichtungen hängt vom Arbeitslasttyp und der Infrastruktur ab:
- Erstellen Sie für allgemeine GPUs oder nicht verteilte Arbeitslasten einen GKE-Cluster ohne GPUDirect RDMA. Diese Konfiguration verwendet ein einzelnes VPC-Netzwerk für die gesamte Kommunikation.
- Erstellen Sie für Cluster-GPUs oder verteilte Arbeitslasten einen GKE-Cluster mit aktiviertem GPUDirect RDMA. Diese Konfiguration verwendet eine Umgebung mit mehreren VPCs, die den Traffic für allgemeine Zwecke von der GPU-zu-GPU-Kommunikation mit hoher Bandbreite trennt.
Netzwerk für Slurm-Clusterbereitstellungen
Mit dem Cluster Toolkit können Sie KI- und ML-Arbeitslasten über anpassbare Blueprints bereitstellen, z. B. für die A4- oder A3 Ultra-Serie.
Die Netzwerkkomponenten, die vom Blueprint für Slurm-Bereitstellungen mit Cluster-GPUs konfiguriert werden, sind folgende:
- Der Blueprint erstellt drei verschiedene VPCs: eine primäre VPC für die Slurm-Steuerungsebene, eine sekundäre VPC für den allgemeinen Traffic auf Hostebene und eine dedizierte Hochleistungs-VPC für die GPU-zu-GPU-Kommunikation.
- Für die GPU-Datenebene wendet der Blueprint ein vorkonfiguriertes, von Google verwaltetes Netzwerkprofil an, das für RoCE optimiert ist.
- Der Blueprint legt einen dedizierten IP-Adressbereich fest, der für den Filestore-Dienst erforderlich ist, der das freigegebene Verzeichnis
/homefür den Cluster bereitstellt. - Er erstellt eine temporäre, isolierte VPC für die Imageerstellung, die nur während der Erstellung des benutzerdefinierten VM-Images für die Clusterknoten verwendet wird.
Netzwerk für Compute Engine-Instanzen
Mit Compute Engine können Sie eigenständige VMs, Compute-Instanzen im Bulk und verwaltete Instanzgruppen (Managed Instance Groups, MIGs) erstellen. Die spezifischen Netzwerkanforderungen hängen vom Infrastrukturmodell des Maschinentyps ab:
- Cluster-GPUs: Für diese Maschinenreihen (A4X Max, A4X, A4, A3 Ultra, A3 Mega und A3 High mit 8 GPUs) ist eine Multi-VPC Netzwerkkonfiguration erforderlich, um den allgemeinen Host-zu-Host-Traffic von der GPU-zu-GPU-Kommunikation mit hoher Bandbreite zu trennen.
- Allgemeine GPUs: Diese Maschinenreihen (G2, G4, A2 und N1 mit T4 oder V100) verwenden eine Single-VPC-Architektur über gVNIC-Schnittstellen für die gesamte Kommunikation. A3 Edge ist eine Ausnahme, für die vier Daten-VPCs und GPUDirect-TCPX erforderlich sind.
Detaillierte Informationen zu den Netzwerkkarten und der Netzwerkkonfiguration für Ihren Maschinentyp finden Sie unter Netzwerk und GPU Maschinen.
Nächste Schritte
- Informationen zu den Best Practices für die Erstellung einer sicheren und stabilen Netzwerkumgebung finden Sie unter Best Practices für Netzwerke.
- Informationen zu den Speicheroptionen in AI Hypercomputer finden Sie unter Speicherdienste für KI- und ML Arbeitslasten.
- Informationen zum Onboarding für die Clusterbereitstellung finden Sie unter KI Infrastruktur planen und erstellen.