Escolher sua infraestrutura de acelerador

Use este documento para identificar a infraestrutura de acelerador ideal para suas cargas de trabalho de inteligência artificial (IA) e machine learning (ML) com base no estágio do ciclo de vida, como prototipagem em pequena escala, inferência em tempo real e treinamento distribuído em massa. O Hipercomputador de IA organiza as ofertas de aceleradores em duas categorias: GPUs gerais e GPUs em cluster.

Infraestrutura de GPU

O Hipercomputador de IA oferece duas categorias distintas de GPUs. Cada categoria tem um modelo de gerenciamento distinto que determina como o sistema processa eventos do ciclo de vida, gerencia a manutenção e otimiza a rede para sua carga de trabalho:

Modelo de gerenciamento de GPU geral

O modelo de gerenciamento de GPU geral foi projetado para cargas de trabalho que priorizam a independência de recursos e a alta disponibilidade. Esse modelo usa o plano de gerenciamento padrão Google Cloud , oferecendo uma experiência familiar para equipes que já usam o Compute Engine ou o GKE.

  • Manutenção:assíncrona. As instâncias individuais são atualizadas de forma independente. Em uma frota de disponibilização de vários nós, um evento de manutenção em um nó não afeta a disponibilidade de outros, permitindo que o tráfego seja redirecionado para nós íntegros sem interromper todo o job.

  • Principais casos de uso:recomendado para tarefas convencionais, como inferência em tempo real, disponibilização do modelo, prototipagem em pequena escala e ambientes de desenvolvimento em que a escala de supercomputação não é necessária.

Série de máquinas de GPU geral

As seguintes séries de máquinas são GPUs gerais:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • A3 High (1, 2 ou 4 GPUs)

Para informações técnicas sobre cada uma das máquinas de GPU geral, consulte Tipos de máquinas com GPU.

Modelo de gerenciamento de GPU em cluster

O modelo de gerenciamento de GPU em cluster é um ambiente de supercomputação projetado para treinamento distribuído em grande escala. Os recursos são gerenciados como um sistema único e fortemente acoplado usando uma pilha de GPU em cluster.

  • Manutenção:coordenada. Esse modelo coordena eventos de manutenção para oferecer suporte a cargas de trabalho fortemente acopladas. Para treinamento distribuído, é possível usar a manutenção sincronizada, em que as atualizações são aplicadas a todos os nós simultaneamente. Essa abordagem impede que as reinicializações de nós interrompam os jobs e maximiza o goodput. Esse modelo também oferece notificações de manutenção de 90 dias.

  • Principais casos de uso:projetado para treinar modelos de base de exaescala com trilhões de parâmetros ou executar simulações complexas de computação de alto desempenho (HPC), como descoberta de medicamentos e dobramento de proteínas.

Série de máquinas de GPU em cluster

As seguintes séries de máquinas são GPUs em cluster:

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High (8 GPUs)

Para informações técnicas sobre cada uma das máquinas de GPU em cluster, consulte Tipos de máquinas com GPU.

Matriz de recursos

Compare as características técnicas e operacionais dos modelos de gerenciamento de GPU geral e GPU em cluster:

Característica Modelo de gerenciamento de GPU geral Modelo de gerenciamento de GPU em cluster
Principais casos de uso Inferência, disponibilização do modelo, prototipagem e desenvolvimento Treinamento distribuído em grande escala e HPC
Manutenção Assíncrona:as atualizações de nós independentes permitem que o tráfego seja redirecionado sem interromper os jobs Coordenada:oferece suporte a atualizações coordenadas (sincronizadas) em todo o cluster para manter os nós sincronizados e maximizar o goodput
Hardware de destino G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge e A3 High (1, 2 ou 4 GPUs) A4X, A4 (Blackwell), A3 Ultra, A3 Mega e A3 High (8 GPUs)
Rede Rede VPC padrão em interfaces gVNIC (com exceção do A3 Edge, que usa GPUDirect-TCPX em várias VPCs) Tecidos especializados de baixa latência (RDMA, RoCE, TCPX ou NVIDIA NVLink)
Pilha de gerenciamento Plano padrão Google Cloud (Compute Engine ou GKE) Pilha de gerenciamento especializada (por exemplo, Cluster Director)
Confiabilidade Reparo automático de nós padrão e tempo de atividade no nível do pod Suíte de recursos e recuperação especializada

Matriz de decisão

Use esta matriz para identificar quais famílias de hardware estão alinhadas à sua intenção de carga de trabalho específica:

Se a carga de trabalho envolver... Infraestrutura de GPU recomendada Série de máquinas recomendada
Prototipagem e desenvolvimento GPUs gerais G2, G4, A2, N1+T4, A3 Edge
Inferência em tempo real (< 100 bilhões de parâmetros) GPUs gerais G2, G4, A2, N1+T4, A3 Edge
Inferência em várias GPUs GPUs em cluster A3, A4
Treinamento e inferência em grande escala GPUs em cluster A4, A3
Treinamento em grande escala (> 500 bilhões de parâmetros) e inferência desagregada GPUs em cluster A4X Max, A4X, A4

Para uma árvore de decisão detalhada que mapeia arquiteturas de modelo diretamente para hardware, consulte Escolher um acelerador.

Depois de estabelecer esses critérios principais, escolha uma plataforma de orquestração. Essa escolha depende da preferência da sua equipe por gerenciamento automatizado ou controle granular sobre o sistema operacional e os drivers.

A seguir