Afficher la topologie des nœuds GKE

Ce document explique comment afficher la topologie physique de vos nœuds Google Kubernetes Engine (GKE) sur des instances Compute Engine A4X Max, A4X, A4, A3 Ultra, A3 Mega et A3 High. Comprendre l'emplacement physique de vos nœuds vous aide à optimiser le placement des pods pour vos charges de travail d'IA.

Avant de commencer

Avant de commencer, effectuez les tâches suivantes :

  • Activez l'API Google Kubernetes Engine.
  • Activer l'API Google Kubernetes Engine
  • Pour utiliser Google Cloud CLI pour cette tâche, installez puis initialisez la gcloud CLI. Si vous avez déjà installé la gcloud CLI, obtenez la dernière version en exécutant la gcloud components update commande. Il est possible que les versions antérieures de la gcloud CLI ne permettent pas d'exécuter les commandes de ce document.

Vous connecter à votre cluster

  • Exécutez la commande suivante pour vous connecter au cluster :

    gcloud container clusters get-credentials CLUSTER_NAME
    

    Remplacez CLUSTER_NAME par le nom de votre cluster.

Comprendre la topologie des nœuds GKE

Vous pouvez comprendre la topologie physique des nœuds GKE sur les instances Compute Engine A4X Max, A4X, A4 et A3 Ultra en vous reportant aux libellés de nœuds suivants :

  • cloud.google.com/gce-topology-block : ID spécifique à l'organisation du bloc réservé dans lequel se trouve la VM. Un bloc est un ensemble de sous-blocs connectés par une couche de structure réseau distribuée.
  • cloud.google.com/gce-topology-subblock : ID spécifique à l'organisation du sous-bloc dans lequel se trouve la VM. Un sous-bloc est un groupe d'hôtes et de matériel de connectivité associé :
    • Pour les VM A4 et A3 Ultra, les hôtes se connectent via une structure réseau Jupiter distribuée à grande échelle Jupiter.
    • Les instances Compute Engine A4X Max et A4X sont organisées en sous-blocs, chacun constituant un domaine NVIDIA NVLink (NVL72). Dans chaque NVL72, les GPU sont étroitement interconnectés via une structure NVLink dédiée à bande passante élevée. Entre les sous-blocs, les GPU peuvent se connecter via des cartes d'interface réseau RDMA à l'aide de la structure RoCE. La communication hôte entre les sous-blocs, ainsi que d'autres trafics réseau tels que le stockage, utilisent la structure réseau Jupiter via des cartes d'interface réseau Ethernet frontend à haut débit.
  • cloud.google.com/gce-topology-host : ID spécifique à l'organisation de l'hôte dans lequel se trouve la VM. Un hôte ou un nœud est une seule machine serveur physique dans le centre de données. Chaque nœud GKE est provisionné sur une instance de VM provisionnée au-dessus d'un hôte physique.
  • kubernetes.io/hostname : nom d'hôte du nœud Kubernetes. Il s'agit généralement également du nom du nœud GKE.

Afficher la topologie physique des nœuds de votre cluster GKE

Exécutez la commande suivante pour obtenir les libellés de nœuds pour les nœuds de votre cluster GKE avec un accélérateur spécifique :

kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \
    -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4

Remplacez ACCELERATOR par le nom de l'accélérateur, par exemple nvidia-h200-141gb.

Le résultat affiche le bloc, le sous-bloc et l'hôte de chacun des nœuds GKE avec l'accélérateur spécifié.

Pour en savoir plus, consultez Afficher la topologie d'une réservation.

Étape suivante