Escolher sua infraestrutura de acelerador

Use este documento para identificar a infraestrutura de acelerador ideal para suas cargas de trabalho de inteligência artificial (IA) e machine learning (ML) com base no estágio do ciclo de vida, como prototipagem em pequena escala, inferência em tempo real e treinamento distribuído em massa. O Hipercomputador de IA organiza as ofertas de aceleradores em duas categorias: GPUs gerais e GPUs em cluster.

Infraestrutura de GPU

O Hipercomputador de IA oferece duas categorias distintas de GPUs. Cada categoria tem um modelo de gerenciamento distinto que determina como o sistema processa eventos do ciclo de vida, gerencia a manutenção e otimiza a rede para sua carga de trabalho:

Modelo de gerenciamento de GPU geral

O modelo de gerenciamento de GPU geral foi projetado para cargas de trabalho que priorizam a independência de recursos e a alta disponibilidade. Esse modelo usa o plano de gerenciamento padrão Google Cloud , proporcionando uma experiência familiar para equipes que já usam o Compute Engine ou o GKE.

  • Manutenção:assíncrona. As instâncias individuais são atualizadas de forma independente. Em uma frota de disponibilização de vários nós, um evento de manutenção em um nó não afeta a disponibilidade de outros, permitindo que o tráfego seja redirecionado para nós íntegros sem interromper todo o job.

  • Principais casos de uso:recomendado para tarefas comuns, como inferência em tempo real, disponibilização de modelos, prototipagem em pequena escala e ambientes de desenvolvimento em que a escala de supercomputação não é necessária.

Série de máquinas de GPU geral

As seguintes séries de máquinas são GPUs gerais:

  • A3 High com 1, 2 ou 4 GPUs
  • A3 Edge
  • A2
  • G4
  • G2
  • N1+T4
  • N1+V100

Para informações técnicas sobre cada uma das máquinas de GPU geral, consulte Tipos de máquinas com GPU.

Modelo de gerenciamento de GPU em cluster

O modelo de gerenciamento de GPU em cluster é um ambiente de supercomputação projetado para treinamento distribuído em grande escala. Os recursos são gerenciados como um sistema único e fortemente acoplado usando uma pilha de GPU em cluster.

  • Manutenção:coordenada. Esse modelo coordena eventos de manutenção para oferecer suporte a cargas de trabalho fortemente acopladas. Para treinamento distribuído, é possível usar a manutenção sincronizada, em que as atualizações são aplicadas em todos os nós simultaneamente. Essa abordagem impede que as reinicializações de nós interrompam os jobs e maximiza o goodput. Esse modelo também oferece notificações de manutenção de 90 dias.

  • Principais casos de uso:projetado para treinar modelos de base de exaescala com trilhões de parâmetros ou executar simulações complexas de computação de alto desempenho (HPC), como descoberta de medicamentos e dobramento de proteínas.

Série de máquinas de GPU em cluster

As seguintes séries de máquinas são GPUs em cluster:

  • A4X Max
  • A4X
  • A4
  • A3 Ultra
  • A3 Mega
  • A3 High com 8 GPUs

Para informações técnicas sobre cada uma das máquinas de GPU em cluster, consulte Tipos de máquinas com GPU.

Matriz de recursos

Compare as características técnicas e operacionais dos modelos de gerenciamento de GPU geral e GPU em cluster:

Característica Modelo de gerenciamento de GPU geral Modelo de gerenciamento de GPU em cluster
Principais casos de uso Inferência, disponibilização de modelos, prototipagem e desenvolvimento Treinamento distribuído em grande escala e HPC
Manutenção Assíncrona:as atualizações de nós independentes permitem que o tráfego seja redirecionado sem interromper os jobs Coordenada:oferece suporte a atualizações coordenadas (sincronizadas) em todo o cluster para manter os nós sincronizados e maximizar o goodput
Hardware de destino A3 High (1, 2 ou 4 GPUs), A3 Edge, G4, G2, A2, N1+T4 e N1+V100 A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs)
Rede Rede VPC padrão em interfaces gVNIC (com exceção do A3 Edge, que usa GPUDirect-TCPX em várias VPCs) Tecidos especializados de baixa latência (RDMA, RoCE, TCPX ou NVIDIA NVLink)
Pilha de gerenciamento Plano padrão Google Cloud (Compute Engine ou GKE) Pilha de gerenciamento especializada (por exemplo, Cluster Director)
Confiabilidade Reparo automático de nós padrão e tempo de atividade no nível do pod Suíte de recursos e recuperação especializada

Matriz de decisão

Use esta matriz para identificar quais famílias de hardware estão alinhadas à sua intenção de carga de trabalho específica:

Se a carga de trabalho envolver... Infraestrutura de GPU recomendada Série de máquinas recomendada
Prototipagem e desenvolvimento GPUs gerais A3 High (1, 2 ou 4 GPUs), A3 Edge, A2, G4, G2, N1+T4, N1+V100
Inferência em tempo real (< 100 bilhões de parâmetros) GPUs gerais A3 High (1, 2 ou 4 GPUs), A3 Edge, A2, G4, G2, N1+T4, N1+V100
Inferência em várias GPUs GPUs em cluster A4, A3 Ultra, A3 Mega, A3 High (8 GPUs)
Treinamento e inferência em grande escala GPUs em cluster A4, A3 Ultra, A3 Mega, A3 High (8 GPUs)
Treinamento em grande escala (> 500 bilhões de parâmetros) e inferência desagregada GPUs em cluster A4X Max, A4X, A4

Para uma árvore de decisão detalhada que mapeia arquiteturas de modelo diretamente para hardware, consulte Escolher um acelerador.

Depois de estabelecer esses critérios principais, escolha uma plataforma de orquestração. Essa escolha depende da preferência da sua equipe por gerenciamento automatizado ou controle granular sobre o sistema operacional e os drivers.

A seguir