Serviços de rede para implantações

Os serviços de rede que você configura dependem da opção de implantação escolhida (VMs ou clusters) e da infraestrutura.

Este documento é destinado a arquitetos, engenheiros de rede e desenvolvedores que querem entender os serviços de rede para implantações do hipercomputador de IA. Este documento pressupõe que você tenha familiaridade básica com conceitos de rede na nuvem e computação distribuída. Para mais informações sobre as opções de implantação, consulte Visão geral das opções de implantação.

Para informações detalhadas sobre arquitetura de rede, protocolos e topologias de hardware , consulte a visão geral da rede de GPU.

Rede para implantações do GKE otimizadas para IA com configurações padrão

Ao criar um cluster do GKE otimizado para IA com configurações padrão, o blueprint do Cluster Toolkit configura a rede da seguinte maneira:

  • O blueprint usa a rede VPC padrão para o cluster principal do GKE.
  • Ele cria duas VPCs extras: uma para uma segunda placa de rede do host e outra para o tráfego de acesso direto à memória remota (RDMA) entre GPUs.
  • O blueprint aplica um perfil de rede pré-configurado e gerenciado pelo Google à VPC usada para o tráfego de GPU. Esse perfil configura automaticamente a rede para desempenho de RDMA de alta velocidade e baixa latência.
  • O blueprint cria automaticamente oito sub-redes dedicadas na VPC RDMA, uma para cada placa de rede RDMA em uma VM de acelerador.
  • Ele configura regras de firewall que permitem todo o tráfego TCP, UDP e ICMP entre nós no cluster.

Rede para implantações do GKE com configuração personalizada

A configuração de rede para configurações personalizadas do GKE depende do tipo de carga de trabalho e da infraestrutura:

  • Para GPUs gerais ou cargas de trabalho não distribuídas, crie um cluster do GKE sem o GPUDirect RDMA. Essa configuração usa uma única rede VPC para todas as comunicações.
  • Para GPUs em cluster ou cargas de trabalho distribuídas, crie um cluster do GKE com o GPUDirect RDMA ativado. Essa configuração usa um ambiente com várias VPCs que separa o tráfego de uso geral da comunicação de alta largura de banda entre GPUs.

Rede para implantações de clusters do Slurm

Use o Cluster Toolkit para implantar cargas de trabalho de IA e ML usando blueprints personalizáveis, como para as séries A4 ou A3 Ultra.

Os componentes de rede configurados pelo blueprint para implantações do Slurm de GPU em cluster são os seguintes:

  • O blueprint cria três VPCs distintas: uma VPC principal para o plano de controle do Slurm, uma VPC secundária para tráfego geral no nível do host e uma VPC dedicada de alta performance para comunicação entre GPUs.
  • Para o plano de dados da GPU, o blueprint aplica um perfil de rede pré-configurado e gerenciado pelo Google otimizado para RoCE.
  • O blueprint define um intervalo de endereços IP dedicado exigido pelo serviço Filestore, que fornece o diretório /home compartilhado para o cluster.
  • Ele cria uma VPC temporária e isolada de criação de imagens usada apenas durante o processo de criação da imagem de VM personalizada para os nós do cluster.

Rede para instâncias do Compute Engine

É possível usar o Compute Engine para criar VMs autônomas, instâncias de computação em massa e grupos de instâncias gerenciadas (MIGs). Os requisitos específicos de rede dependem do modelo de infraestrutura do tipo de máquina:

  • GPUs em cluster: essas séries de máquinas (A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High com 8 GPUs) exigem uma configuração de rede com várias VPCs para separar o tráfego geral de host para host da comunicação de alta largura de banda entre GPUs.
  • GPUs gerais: essas séries de máquinas (G2, G4, A2 e N1 com T4 ou V100) usam uma arquitetura de VPC única em interfaces gVNIC para todas as comunicações. O A3 Edge é uma exceção que exige quatro VPCs de dados e GPUDirect-TCPX.

Para informações detalhadas sobre as placas de rede e a configuração de rede do seu tipo de máquina, consulte Máquinas de rede e GPU máquinas.

A seguir