Servicios de red para implementaciones

Los servicios de red que configures dependerán de la opción de implementación (VMs o clústeres) y la infraestructura que elijas.

Este documento está destinado a arquitectos, ingenieros de redes y desarrolladores que desean comprender los servicios de red para sus implementaciones de AI Hypercomputer. En este documento, se supone que tienes conocimientos básicos de los conceptos de redes en la nube y procesamiento distribuido. Para obtener más información sobre las opciones de implementación, consulta Descripción general de las opciones de implementación.

Para obtener información detallada sobre la arquitectura de red, los protocolos y las topologías de hardware , consulta la descripción general de las redes de GPU.

Redes para implementaciones de GKE optimizadas para IA con configuraciones predeterminadas

Cuando creas un clúster de GKE optimizado para IA con la configuración predeterminada, el plano de Cluster Toolkit configura la red de la siguiente manera:

  • El plano usa la red de VPC predeterminada para el clúster principal de GKE.
  • Crea dos VPC adicionales: una para una segunda tarjeta de interfaz de red (NIC) del host y otra para el tráfico de acceso directo remoto a la memoria (RDMA) de GPU a GPU.
  • El plano aplica un perfil de red preconfigurado y administrado por Google a la VPC que se usa para el tráfico de GPU. Este perfil configura automáticamente la red para un rendimiento de RDMA de alta velocidad y baja latencia.
  • El plano crea automáticamente ocho subredes dedicadas dentro de la VPC de RDMA, una para cada NIC de RDMA en una VM de acelerador.
  • Configura reglas de firewall que permiten todo el tráfico de TCP, ICMP y UDP entre los nodos dentro del clúster.

Redes para implementaciones de GKE con configuración personalizada

La configuración de red para las configuraciones personalizadas de GKE depende del tipo de carga de trabajo y la infraestructura:

  • Para las GPU generales o las cargas de trabajo no distribuidas, crea un clúster de GKE sin el RDMA de GPUDirect. Esta configuración usa una sola red de VPC para toda la comunicación.
  • Para las GPU en clúster o las cargas de trabajo distribuidas, crea un clúster de GKE con el RDMA de GPUDirect habilitado. Esta configuración usa un entorno de múltiples VPC que separa el tráfico de uso general de la comunicación de GPU a GPU de gran ancho de banda.

Redes para implementaciones de clústeres de Slurm

Usa Cluster Toolkit para implementar cargas de trabajo de IA y AA a través de planos personalizables, como para las series A4 o A3 Ultra.

Los componentes de red configurados por el plano para las implementaciones de Slurm de GPU en clúster son los siguientes:

  • El plano crea tres VPC distintas: una VPC principal para el plano de control de Slurm, una VPC secundaria para el tráfico general a nivel del host y una VPC dedicada de alto rendimiento para la comunicación de GPU a GPU.
  • Para el plano de datos de GPU, el plano aplica un perfil de red preconfigurado y administrado por Google optimizado para RoCE.
  • El plano establece un rango de direcciones IP dedicadas que requiere el servicio de Filestore, que proporciona el directorio /home compartido para el clúster.
  • Crea una VPC de compilación de imágenes aislada y temporal que se usa solo durante el proceso de compilación de la imagen de VM personalizada para los nodos del clúster.

Redes para instancias de Compute Engine

Puedes usar Compute Engine para crear VMs independientes, instancias de procesamiento masivo y grupos de instancias administrados (MIGs). Los requisitos de red específicos dependen del modelo de infraestructura del tipo de máquina:

  • GPU en clúster: Estas series de máquinas (A4X Max, A4X, A4, A3 Ultra, A3 Mega y A3 High con 8 GPUs) requieren una configuración de red de múltiples VPC para separar el tráfico general de host a host de la comunicación de GPU a GPU de gran ancho de banda.
  • GPU generales: Estas series de máquinas (G2, G4, A2 y N1 con T4 o V100) usan una arquitectura de una sola VPC a través de interfaces gVNIC para toda la comunicación. A3 Edge es una excepción que requiere cuatro VPC de datos y GPUDirect-TCPX.

Para obtener información detallada sobre las NIC y la configuración de red para tu tipo de máquina, consulta Redes y máquinas de GPU máquinas.

¿Qué sigue?