Visualiza la topología de nodos de GKE

En este documento, se muestra cómo ver la topología física de tus nodos de Google Kubernetes Engine (GKE) en instancias de Compute Engine A4X Max, A4X, A4, A3 Ultra, A3 Mega y A3 High. Comprender la ubicación física de tus nodos te ayuda a optimizar la ubicación de los pods para tus cargas de trabajo de IA.

Antes de comenzar

Antes de comenzar, asegúrate de haber realizado las siguientes tareas:

  • Habilita la API de Google Kubernetes Engine.
  • Habilitar la API de Google Kubernetes Engine
  • Si deseas usar Google Cloud CLI para esta tarea, instala y, luego, inicializa the gcloud CLI. Si ya instalaste gcloud CLI, ejecuta el comando gcloud components update para obtener la versión más reciente. Es posible que las versiones anteriores de gcloud CLI no admitan la ejecución de los comandos de este documento.

Conéctate a tu clúster.

  • Ejecuta el siguiente comando para conectarte a tu clúster:

    gcloud container clusters get-credentials CLUSTER_NAME
    

    Reemplaza CLUSTER_NAME por el nombre del clúster.

Comprende la topología de nodos de GKE

Para comprender la topología física de los nodos de GKE en instancias de Compute Engine A4X Max, A4X, A4 y A3 Ultra, consulta las siguientes etiquetas de nodo:

  • cloud.google.com/gce-topology-block: Es el ID específico de la organización del bloque reservado en el que se encuentra la VM. Un bloque es una colección de subbloques conectados por una capa de estructura de red distribuida.
  • cloud.google.com/gce-topology-subblock: Es el ID específico de la organización del subbloque en el que se encuentra la VM. Un subbloque es un grupo de hosts y hardware de conectividad asociado:
    • En el caso de las VMs A4 y A3 Ultra, los hosts se conectan a través de una estructura de red Jupiter distribuida a gran escala .
    • Las instancias de Compute Engine A4X Max y A4X se organizan en subbloques, cada uno de los cuales constituye un dominio NVLink de NVIDIA (NVL72). Dentro de cada NVL72, las GPUs están interconectadas a través de una estructura NVLink dedicada de alto ancho de banda. En los subbloques, las GPUs pueden conectarse a través de NICs RDMA con la estructura RoCE. La comunicación del host en los subbloques, así como otro tráfico de red, como el almacenamiento, usa la estructura de red Jupiter a través de NICs Ethernet front-end de alta velocidad.
  • cloud.google.com/gce-topology-host: Es el ID específico de la organización del host en el que se encuentra la VM. Un host o nodo es una sola máquina de servidor físico en el centro de datos. Cada nodo de GKE se aprovisiona en una instancia de VM que se aprovisiona sobre un host físico.
  • kubernetes.io/hostname: Es el nombre de host del nodo de Kubernetes. Por lo general, también es el nombre del nodo de GKE.

Visualiza la topología física de los nodos de tu clúster de GKE

Ejecuta el siguiente comando para obtener las etiquetas de nodo de los nodos de tu clúster de GKE con un acelerador específico:

kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \
    -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4

Reemplaza ACCELERATOR por el nombre del acelerador, como nvidia-h200-141gb.

El resultado muestra el bloque, el subbloque y el host de cada uno de los nodos de GKE con el acelerador especificado.

Para obtener más información, consulta Visualiza la topología de una reserva.

¿Qué sigue?