Neste documento, mostramos como visualizar a topologia física dos nós do Google Kubernetes Engine (GKE) nas instâncias A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High do Compute Engine. Entender a localização física dos nós ajuda a otimizar o posicionamento de pods para cargas de trabalho de IA.
Antes de começar
Antes de começar, verifique se você realizou as tarefas a seguir:
- Ativar a API Google Kubernetes Engine. Ativar a API Google Kubernetes Engine
- Se você quiser usar a Google Cloud CLI para essa tarefa,
instale e, em seguida,
inicialize a
CLI gcloud. Se você instalou a CLI gcloud anteriormente, instale a versão mais recente executando o comando
gcloud components update. Talvez as versões anteriores da CLI gcloud não sejam compatíveis com a execução dos comandos neste documento.
Conectar-se ao seu cluster
Execute o seguinte comando para se conectar ao seu cluster:
gcloud container clusters get-credentials CLUSTER_NAMESubstitua
CLUSTER_NAMEpelo nome do cluster.
Entender a topologia de nós do GKE
É possível entender a topologia física dos nós do GKE nas instâncias A4X Max, A4X, A4 e A3 Ultra do Compute Engine consultando os seguintes rótulos de nó:
cloud.google.com/gce-topology-block: o ID específico da organização do bloco reservado em que a VM está localizada. Um bloco é uma coleção de sub-blocos conectados por uma camada de malha de rede distribuída.cloud.google.com/gce-topology-subblock: o ID específico da organização do sub-bloco em que a VM está localizada. Um sub-bloco é um grupo de hosts e hardware de conectividade associado:- Para VMs A4 e A3 Ultra, os hosts se conectam por uma malha de rede Jupiter distribuída em grande escala .
- As instâncias A4X Max e A4X do Compute Engine são organizadas em sub-blocos, cada um constituindo um domínio NVIDIA NVLink (NVL72). Em cada NVL72, as GPUs são interconectadas por uma malha NVLink dedicada de alta largura de banda. Entre os sub-blocos, as GPUs podem se conectar por NICs RDMA usando a malha RoCE. A comunicação do host entre sub-blocos, bem como outros tráfegos de rede, como armazenamento, usa a malha de rede Jupiter por meio de NICs Ethernet de front-end de alta velocidade.
cloud.google.com/gce-topology-host: o ID específico da organização do host em que a VM está localizada. Um host ou nó é uma única máquina de servidor físico no data center. Cada nó do GKE é provisionado em uma instância de VM que é provisionada em um host físico.kubernetes.io/hostname: o nome do host do nó do Kubernetes. Normalmente, esse também é o nome do nó do GKE.
Visualizar a topologia física dos nós do cluster do GKE
Execute o comando a seguir para receber os rótulos de nó dos nós do cluster do GKE com um acelerador específico:
kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \ -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4
Substitua ACCELERATOR pelo nome do acelerador, como nvidia-h200-141gb.
A saída mostra o bloco, o sub-bloco e o host de cada um dos nós do GKE com o acelerador especificado.
Para mais informações, consulte Visualizar a topologia de uma reserva.
A seguir
- Saiba como programar cargas de trabalho do GKE com o agendamento com reconhecimento de topologia.
- Saiba como gerenciar eventos de manutenção de host, upgrades de cluster e relatórios de host com falha para clusters do GKE.