Visão geral das GPUs em cluster

As GPUs em cluster são otimizadas para cargas de trabalho de inteligência artificial (IA) e machine learning (ML) que priorizam o treinamento distribuído em grande escala, a inferência de vários hosts e tarefas complexas de computação de alto desempenho (HPC).

As GPUs em cluster permitem que as equipes implantem e escalonem milhares de aceleradores interconectados como um único sistema fortemente acoplado usando estruturas de rede especializadas e manutenção sincronizada. Elas são ideais para cargas de trabalho que exigem computação, memória e sincronização de rede de alta velocidade. Os casos de uso comuns incluem modelos de fundação de pré-treinamento com trilhões de parâmetros, disponibilização de modelos de fronteira e simulações para descoberta de medicamentos.

Principais características das GPUs em cluster

  • Manutenção sincronizada: Google Cloud atualiza todos os nós do cluster simultaneamente, impedindo que uma única reinicialização de nó interrompa um job.
  • Monitoramento de integridade automatizado: o sistema identifica proativamente os nós mais lentos e monitora falhas de hardware ou corrupção silenciosa de dados.
  • Substituição proativa de nós: o sistema remove e reprograma VMs com desempenho insatisfatório em máquinas íntegras de um pool de reserva.
  • Topologia alinhada por rails: uma topologia alinhada por rails isola o tráfego de GPU para GPU da comunicação de host padrão para ajudar a garantir um desempenho sem instabilidade para coordenação de vários nós.
  • Protocolos avançados: essas séries de máquinas oferecem suporte a interconexões de alta largura de banda , incluindo GPUDirect RDMA (com base em RoCE).

Famílias de GPUs em cluster e especificações técnicas

Analise as cargas de trabalho e as especificações de hardware para a série de máquinas de GPU em cluster premium nestas tabelas. Para treinamento em exaescala, use as séries A4X ou A3 Ultra.

Séries A4X Max e A4X

Se você estiver treinando modelos de fundação em exaescala ou executando simulações de computação de alto desempenho (HPC) bare metal altamente complexas, use as séries de máquinas A4X Max ou A4X. Essas séries apresentam superchips NVIDIA GB300 Grace Blackwell Ultra para lidar com demandas extremas de computação e memória.

A4X Max (bare metal)

Os tipos de máquina A4X Max usam superchips NVIDIA GB300 Grace Blackwell Ultra (nvidia-gb300) e são ideais para treinamento e disponibilização de modelos de fundação. Os tipos de máquina A4X Max estão disponíveis como instâncias bare metal.

A4X Max é uma plataforma de exaescala baseada em NVIDIA GB300 NVL72. Cada máquina tem dois soquetes com CPUs NVIDIA Grace com núcleos Arm Neoverse V2. Essas CPUs estão conectadas a quatro GPUs NVIDIA B300 Blackwell com comunicação rápida de chip para chip (NVLink-C2C).

Superchips NVIDIA GB300 Grace Blackwell Ultra conectados
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3e)
a4x-maxgpu-4g-metal 144 960 12.000 6 3.600 4 1.116

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre a largura de banda da rede, consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

A4X

Os tipos de máquina A4X usam superchips NVIDIA GB200 Grace Blackwell (nvidia-gb200) e são ideais para treinamento de modelo e disponibilização de modelos de fundação.

A4X é uma plataforma de exaescala baseada em NVIDIA GB200 NVL72. Cada máquina tem dois soquetes com CPUs NVIDIA Grace com núcleos Arm Neoverse V2. Essas CPUs estão conectadas a quatro GPUs NVIDIA B200 Blackwell com comunicação rápida de chip para chip (NVLink-C2C) .

Superchips NVIDIA GB200 Grace Blackwell conectados
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3e)
a4x-highgpu-4g 140 884 12.000 6 2.000 4 744

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre a largura de banda da rede, consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

Série A4

Se o objetivo for treinar modelos de fundação de última geração que exigem escalonamento de processamento paralelo em massa, use a série de máquinas A4 para otimizar o tempo de processamento e maximizar a capacidade de hardware.

Os tipos de máquina A4 têm GPUs NVIDIA B200 Blackwell (nvidia-b200) conectadas e são ideais para treinamento e disponibilização de modelos de fundação.

GPUs NVIDIA B200 Blackwell conectadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3e)
a4-highgpu-8g 224 3.968 12.000 10 3.600 8 1.440

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre a largura de banda da rede, consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

Série A3 (Ultra, Mega e High com 8 GPUs)

Se você precisar executar treinamentos distribuídos em grande escala ou disponibilizar modelos de fronteira em vários hosts com tabelas de conjuntos de dados grandes, use a série de máquinas A3 para minimizar a latência de rede de host para host.

A3 Ultra

GPUs NVIDIA H200 conectadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3e)
a3-ultragpu-8g 224 2.952 12.000 10 3.600 8 1128

A3 Mega

GPUs NVIDIA H100 conectadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3)
a3-megagpu-8g 208 1.872 6.000 9 1.800 8 640

A3 Alto

GPUs NVIDIA H100 conectadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1.500 1 50 2 160
a3-highgpu-4g 104 936 3.000 1 100 4 320
a3-highgpu-8g 208 1.872 6.000 5 1.000 8 640

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre a largura de banda da rede, consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

Aquisição de capacidade

A aquisição de capacidade de computação para GPUs em cluster exige coordenação para gerenciar a oferta e a demanda de aceleradores de alto desempenho. Como esses recursos estão fisicamente localizados em estruturas de rede especializadas, é necessário solicitá-los por fluxos de trabalho gerenciados.

É possível reservar capacidade pela equipe da conta ou usar reservas futuras e o Dynamic Workload Scheduler.

A seguir