Ver a topologia de nós do GKE

Neste documento, mostramos como visualizar a topologia física dos nós do Google Kubernetes Engine (GKE) nas instâncias A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High do Compute Engine. Entender a localização física dos nós ajuda a otimizar o posicionamento de pods para cargas de trabalho de IA.

Antes de começar

Antes de começar, verifique se você realizou as tarefas a seguir:

  • Ativar a API Google Kubernetes Engine.
  • Ativar a API Google Kubernetes Engine
  • Se você quiser usar a Google Cloud CLI para essa tarefa, instale e, em seguida, inicialize a CLI gcloud. Se você instalou a CLI gcloud anteriormente, instale a versão mais recente executando o comando gcloud components update. Talvez as versões anteriores da CLI gcloud não sejam compatíveis com a execução dos comandos neste documento.

Conectar-se ao seu cluster

  • Execute o seguinte comando para se conectar ao seu cluster:

    gcloud container clusters get-credentials CLUSTER_NAME
    

    Substitua CLUSTER_NAME pelo nome do cluster.

Entender a topologia de nós do GKE

É possível entender a topologia física dos nós do GKE nas instâncias A4X Max, A4X, A4 e A3 Ultra do Compute Engine consultando os seguintes rótulos de nó:

  • cloud.google.com/gce-topology-block: o ID específico da organização do bloco reservado em que a VM está localizada. Um bloco é uma coleção de sub-blocos conectados por uma camada de malha de rede distribuída.
  • cloud.google.com/gce-topology-subblock: o ID específico da organização do sub-bloco em que a VM está localizada. Um sub-bloco é um grupo de hosts e hardware de conectividade associado:
    • Para VMs A4 e A3 Ultra, os hosts se conectam por uma malha de rede Jupiter distribuída em grande escala .
    • As instâncias A4X Max e A4X do Compute Engine são organizadas em sub-blocos, cada um constituindo um domínio NVIDIA NVLink (NVL72). Em cada NVL72, as GPUs são interconectadas por uma malha NVLink dedicada de alta largura de banda. Entre os sub-blocos, as GPUs podem se conectar por NICs RDMA usando a malha RoCE. A comunicação do host entre sub-blocos, bem como outros tráfegos de rede, como armazenamento, usa a malha de rede Jupiter por meio de NICs Ethernet de front-end de alta velocidade.
  • cloud.google.com/gce-topology-host: o ID específico da organização do host em que a VM está localizada. Um host ou nó é uma única máquina de servidor físico no data center. Cada nó do GKE é provisionado em uma instância de VM que é provisionada em um host físico.
  • kubernetes.io/hostname: o nome do host do nó do Kubernetes. Normalmente, esse também é o nome do nó do GKE.

Visualizar a topologia física dos nós do cluster do GKE

Execute o comando a seguir para receber os rótulos de nó dos nós do cluster do GKE com um acelerador específico:

kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \
    -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4

Substitua ACCELERATOR pelo nome do acelerador, como nvidia-h200-141gb.

A saída mostra o bloco, o sub-bloco e o host de cada um dos nós do GKE com o acelerador especificado.

Para mais informações, consulte Visualizar a topologia de uma reserva.

A seguir