Services réseau pour les déploiements

Les services réseau que vous configurez dépendent de l'option de déploiement (VM ou clusters) et de l'infrastructure que vous avez choisies.

Ce document est destiné aux architectes, aux ingénieurs réseau et aux développeurs qui souhaitent comprendre les services réseau pour leurs déploiements AI Hypercomputer. Dans ce document, nous partons du principe que vous connaissez les concepts de base de la mise en réseau cloud et du calcul distribué. Pour en savoir plus sur les options de déploiement, consultez la présentation des options de déploiement.

Pour obtenir des informations détaillées sur l'architecture réseau, les protocoles et les topologies matérielles , consultez la présentation de la mise en réseau GPU.

Mise en réseau pour les déploiements GKE optimisés pour l'IA avec des configurations par défaut

Lorsque vous créez un cluster GKE optimisé pour l'IA avec les paramètres par défaut, le plan Cluster Toolkit configure le réseau comme suit :

  • Le plan utilise le réseau VPC par défaut pour le cluster GKE principal.
  • Il crée deux VPC supplémentaires : un pour une deuxième carte d'interface réseau hôte et un autre pour le trafic d'accès direct à la mémoire à distance (RDMA) entre les GPU.
  • Le plan applique un profil réseau géré par Google préconfiguré au VPC utilisé pour le trafic GPU. Ce profil configure automatiquement le réseau pour des performances RDMA à haut débit et à faible latence.
  • Le plan crée automatiquement huit sous-réseaux dédiés dans le VPC RDMA, un pour chaque carte d'interface réseau RDMA sur une VM d'accélérateur.
  • Il configure des règles de pare-feu qui autorisent tout le trafic TCP, UDP et ICMP entre les nœuds du cluster.

Mise en réseau pour les déploiements GKE avec une configuration personnalisée

La configuration réseau pour les configurations GKE personnalisées dépend du type de charge de travail et de l'infrastructure :

  • Pour les GPU généraux ou les charges de travail non distribuées, créez un cluster GKE sans GPUDirect RDMA. Cette configuration utilise un seul réseau VPC pour toutes les communications.
  • Pour les GPU en cluster ou les charges de travail distribuées, créez un cluster GKE avec GPUDirect RDMA activé. Cette configuration utilise un environnement multi-VPC qui sépare le trafic à usage général de la communication à bande passante élevée entre les GPU.

Mise en réseau pour les déploiements de clusters Slurm

Utilisez Cluster Toolkit pour déployer des charges de travail d'IA et de ML via des plans personnalisables, par exemple pour les séries A4 ou A3 Ultra.

Les composants réseau configurés par le plan pour les déploiements Slurm de GPU en cluster sont les suivants :

  • Le plan crée trois VPC distincts : un VPC principal pour le plan de contrôle Slurm, un VPC secondaire pour le trafic général au niveau de l'hôte et un VPC dédié hautes performances pour la communication entre les GPU.
  • Pour le plan de données GPU, le plan applique un profil réseau géré par Google préconfiguré et optimisé pour RoCE.
  • Le plan définit une plage d'adresses IP dédiée requise par le service Filestore, qui fournit le répertoire /home partagé pour le cluster.
  • Il crée un VPC temporaire et isolé de création d'image utilisé uniquement lors du processus de création de l'image de VM personnalisée pour les nœuds de cluster.

Mise en réseau pour les instances Compute Engine

Vous pouvez utiliser Compute Engine pour créer des VM autonomes, des instances de calcul groupées et des groupes d'instances gérés (MIG). Les exigences réseau spécifiques dépendent du modèle d'infrastructure du type de machine :

  • GPU en cluster : ces séries de machines (A4X Max, A4X, A4, A3 Ultra, A3 Mega et A3 High avec 8 GPU) nécessitent une configuration réseau multi-VPC pour séparer le trafic général entre hôtes de la communication à bande passante élevée entre les GPU.
  • GPU généraux : ces séries de machines (G2, G4, A2 et N1 avec T4 ou V100) utilisent une architecture à un seul VPC sur des interfaces gVNIC pour toutes les communications. A3 Edge est une exception qui nécessite quatre VPC de données et GPUDirect-TCPX.

Pour obtenir des informations détaillées sur les cartes d'interface réseau et la configuration réseau de votre type de machine, consultez Mise en réseau et machines GPU.

Étape suivante