Visualizza la topologia dei nodi GKE

Questo documento mostra come visualizzare la topologia fisica dei nodi Google Kubernetes Engine (GKE) sulle istanze di Compute Engine A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High. Comprendere la posizione fisica dei nodi ti aiuta a ottimizzare il posizionamento dei pod per i carichi di lavoro AI.

Prima di iniziare

Prima di iniziare, assicurati di aver eseguito le seguenti attività:

  • Abilita l'API Google Kubernetes Engine.
  • Abilita l'API Google Kubernetes Engine
  • Per utilizzare Google Cloud CLI per questa attività, installala e poi inizializza gcloud CLI. Se hai già installato gcloud CLI, scarica l'ultima versione eseguendo il gcloud components update comando. Le versioni precedenti di gcloud CLI potrebbero non supportare l'esecuzione dei comandi in questo documento.

Connessione al tuo cluster

  • Esegui questo comando per connetterti al cluster:

    gcloud container clusters get-credentials CLUSTER_NAME
    

    Sostituisci CLUSTER_NAME con il nome del cluster.

Informazioni sulla topologia dei nodi GKE

Puoi comprendere la topologia fisica dei nodi GKE sulle istanze di Compute Engine A4X Max, A4X, A4 e A3 Ultra facendo riferimento alle seguenti etichette dei nodi:

  • cloud.google.com/gce-topology-block: l'ID specifico dell'organizzazione del blocco riservato in cui si trova la VM. Un blocco è una raccolta di sottoblocchi collegati da uno strato di fabric di rete distribuito.
  • cloud.google.com/gce-topology-subblock: l'ID specifico dell'organizzazione del sottoblocco in cui si trova la VM. Un sottoblocco è un gruppo di host e hardware di connettività associato:
    • Per le VM A4 e A3 Ultra, gli host si connettono tramite un fabric di rete Jupiter distribuito su larga scala .
    • Le istanze di Compute Engine A4X Max e A4X sono organizzate in sottoblocchi, ognuno dei quali costituisce un dominio NVIDIA NVLink (NVL72). All'interno di ogni NVL72, le GPU sono strettamente interconnesse tramite un fabric NVLink dedicato a banda larga. Tra i sottoblocchi, le GPU possono connettersi tramite NIC RDMA utilizzando il fabric RoCE. La comunicazione host tra i sottoblocchi, nonché altro traffico di rete come lo spazio di archiviazione, utilizza il fabric di rete Jupiter tramite NIC Ethernet front-end ad alta velocità.
  • cloud.google.com/gce-topology-host: l'ID specifico dell'organizzazione dell'host in cui si trova la VM. Un host o un nodo è una singola macchina server fisica nel data center. Ogni nodo GKE viene sottoposto a provisioning su un'istanza VM di cui viene eseguito il provisioning su un host fisico.
  • kubernetes.io/hostname: il nome host del nodo Kubernetes. In genere è anche il nome del nodo GKE.

Visualizzare la topologia fisica dei nodi del cluster GKE

Esegui questo comando per ottenere le etichette dei nodi per i nodi del cluster GKE con un acceleratore specifico:

kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \
    -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4

Sostituisci ACCELERATOR con il nome dell'acceleratore, ad esempio nvidia-h200-141gb.

L'output mostra il blocco, il sottoblocco e l'host di ciascuno dei nodi GKE con l'acceleratore specificato.

Per saperne di più, consulta Visualizzare la topologia di una prenotazione.

Passaggi successivi