Ce document explique comment afficher la topologie physique de vos nœuds Google Kubernetes Engine (GKE) sur des instances Compute Engine A4X Max, A4X, A4, A3 Ultra, A3 Mega et A3 High. Comprendre l'emplacement physique de vos nœuds vous aide à optimiser le placement des pods pour vos charges de travail d'IA.
Avant de commencer
Avant de commencer, effectuez les tâches suivantes :
- Activez l'API Google Kubernetes Engine. Activer l'API Google Kubernetes Engine
- Pour utiliser Google Cloud CLI pour cette tâche,
installez puis
initialisez la
gcloud CLI. Si vous avez déjà installé la gcloud CLI, obtenez la dernière
version en exécutant la
gcloud components updatecommande. Il est possible que les versions antérieures de la gcloud CLI ne permettent pas d'exécuter les commandes de ce document.
Vous connecter à votre cluster
Exécutez la commande suivante pour vous connecter au cluster :
gcloud container clusters get-credentials CLUSTER_NAMERemplacez
CLUSTER_NAMEpar le nom de votre cluster.
Comprendre la topologie des nœuds GKE
Vous pouvez comprendre la topologie physique des nœuds GKE sur les instances Compute Engine A4X Max, A4X, A4 et A3 Ultra en vous reportant aux libellés de nœuds suivants :
cloud.google.com/gce-topology-block: ID spécifique à l'organisation du bloc réservé dans lequel se trouve la VM. Un bloc est un ensemble de sous-blocs connectés par une couche de structure réseau distribuée.cloud.google.com/gce-topology-subblock: ID spécifique à l'organisation du sous-bloc dans lequel se trouve la VM. Un sous-bloc est un groupe d'hôtes et de matériel de connectivité associé :- Pour les VM A4 et A3 Ultra, les hôtes se connectent via une structure réseau Jupiter distribuée à grande échelle Jupiter.
- Les instances Compute Engine A4X Max et A4X sont organisées en sous-blocs, chacun constituant un domaine NVIDIA NVLink (NVL72). Dans chaque NVL72, les GPU sont étroitement interconnectés via une structure NVLink dédiée à bande passante élevée. Entre les sous-blocs, les GPU peuvent se connecter via des cartes d'interface réseau RDMA à l'aide de la structure RoCE. La communication hôte entre les sous-blocs, ainsi que d'autres trafics réseau tels que le stockage, utilisent la structure réseau Jupiter via des cartes d'interface réseau Ethernet frontend à haut débit.
cloud.google.com/gce-topology-host: ID spécifique à l'organisation de l'hôte dans lequel se trouve la VM. Un hôte ou un nœud est une seule machine serveur physique dans le centre de données. Chaque nœud GKE est provisionné sur une instance de VM provisionnée au-dessus d'un hôte physique.kubernetes.io/hostname: nom d'hôte du nœud Kubernetes. Il s'agit généralement également du nom du nœud GKE.
Afficher la topologie physique des nœuds de votre cluster GKE
Exécutez la commande suivante pour obtenir les libellés de nœuds pour les nœuds de votre cluster GKE avec un accélérateur spécifique :
kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \ -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4
Remplacez ACCELERATOR par le nom de l'accélérateur, par exemple nvidia-h200-141gb.
Le résultat affiche le bloc, le sous-bloc et l'hôte de chacun des nœuds GKE avec l'accélérateur spécifié.
Pour en savoir plus, consultez Afficher la topologie d'une réservation.
Étape suivante
- Découvrez comment planifier des charges de travail GKE avec la planification sensible à la topologie.
- Découvrez comment gérer les événements de maintenance de l'hôte, les mises à niveau de cluster et les rapports d'hôte défectueux pour les clusters GKE