As GPUs em cluster são otimizadas para cargas de trabalho de inteligência artificial (IA) e machine learning (ML) que priorizam o treinamento distribuído em grande escala, a inferência de vários hosts e tarefas complexas de computação de alto desempenho (HPC).
As GPUs em cluster permitem que as equipes implantem e escalonem milhares de aceleradores interconectados como um único sistema fortemente acoplado usando estruturas de rede especializadas e manutenção sincronizada. Elas são ideais para cargas de trabalho que exigem computação, memória e sincronização de rede de alta velocidade. Os casos de uso comuns incluem modelos de fundação de pré-treinamento com trilhões de parâmetros, disponibilização de modelos de fronteira e simulações para descoberta de medicamentos.
Principais características das GPUs em cluster
- Manutenção sincronizada: Google Cloud atualiza todos os nós do cluster simultaneamente, impedindo que uma única reinicialização de nó interrompa um job.
- Monitoramento de integridade automatizado: o sistema identifica proativamente os nós mais lentos e monitora falhas de hardware ou corrupção silenciosa de dados.
- Substituição proativa de nós: o sistema remove e reprograma VMs com desempenho insatisfatório em máquinas íntegras de um pool de reserva.
- Topologia alinhada por rails: uma topologia alinhada por rails isola o tráfego de GPU para GPU da comunicação de host padrão para ajudar a garantir um desempenho sem instabilidade para coordenação de vários nós.
- Protocolos avançados: essas séries de máquinas oferecem suporte a interconexões de alta largura de banda , incluindo GPUDirect RDMA (com base em RoCE).
Famílias de GPUs em cluster e especificações técnicas
Analise as cargas de trabalho e as especificações de hardware para a série de máquinas de GPU em cluster premium nestas tabelas. Para treinamento em exaescala, use as séries A4X ou A3 Ultra.
Séries A4X Max e A4X
Se você estiver treinando modelos de fundação em exaescala ou executando simulações de computação de alto desempenho (HPC) bare metal altamente complexas, use as séries de máquinas A4X Max ou A4X. Essas séries apresentam superchips NVIDIA GB300 Grace Blackwell Ultra para lidar com demandas extremas de computação e memória.
A4X Max (bare metal)
Os tipos de máquina A4X Max
usam superchips NVIDIA GB300 Grace Blackwell Ultra (nvidia-gb300) e
são ideais para treinamento e disponibilização de modelos de fundação. Os tipos de máquina A4X Max estão disponíveis
como instâncias bare metal.
A4X Max é uma plataforma de exaescala baseada em NVIDIA GB300 NVL72. Cada máquina tem dois soquetes com CPUs NVIDIA Grace com núcleos Arm Neoverse V2. Essas CPUs estão conectadas a quatro GPUs NVIDIA B300 Blackwell com comunicação rápida de chip para chip (NVLink-C2C).
| Superchips NVIDIA GB300 Grace Blackwell Ultra conectados | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Contagem de vCPU1 | Memória da instância (GB) | SSD local anexado (GiB) | Contagem de NICs físicas | Largura de banda máxima da rede (Gbps)2 | Contagem de GPUs | Memória da GPU3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12.000 | 6 | 3.600 | 4 | 1.116 |
1Uma vCPU é implementada como um único hyper-thread de hardware em uma das
plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores.
Para mais informações sobre a largura de banda da rede,
consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para
armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.
A4X
Os tipos de máquina A4X
usam superchips NVIDIA GB200 Grace Blackwell (nvidia-gb200) e
são ideais para treinamento de modelo e disponibilização de modelos de fundação.
A4X é uma plataforma de exaescala baseada em NVIDIA GB200 NVL72. Cada máquina tem dois soquetes com CPUs NVIDIA Grace com núcleos Arm Neoverse V2. Essas CPUs estão conectadas a quatro GPUs NVIDIA B200 Blackwell com comunicação rápida de chip para chip (NVLink-C2C) .
| Superchips NVIDIA GB200 Grace Blackwell conectados | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Contagem de vCPU1 | Memória da instância (GB) | SSD local anexado (GiB) | Contagem de NICs físicas | Largura de banda máxima da rede (Gbps)2 | Contagem de GPUs | Memória da GPU3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12.000 | 6 | 2.000 | 4 | 744 |
1Uma vCPU é implementada como um único hyper-thread de hardware em uma das
plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores.
Para mais informações sobre a largura de banda da rede,
consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para
armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.
Série A4
Se o objetivo for treinar modelos de fundação de última geração que exigem escalonamento de processamento paralelo em massa, use a série de máquinas A4 para otimizar o tempo de processamento e maximizar a capacidade de hardware.
Os tipos de máquina A4
têm
GPUs NVIDIA B200 Blackwell
(nvidia-b200) conectadas e são ideais para treinamento e disponibilização de modelos de fundação.
| GPUs NVIDIA B200 Blackwell conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Contagem de vCPU1 | Memória da instância (GB) | SSD local anexado (GiB) | Contagem de NICs físicas | Largura de banda máxima da rede (Gbps)2 | Contagem de GPUs | Memória da GPU3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3.968 | 12.000 | 10 | 3.600 | 8 | 1.440 |
1Uma vCPU é implementada como um único hyper-thread de hardware em uma das
plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores.
Para mais informações sobre a largura de banda da rede, consulte
Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para
armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.
Série A3 (Ultra, Mega e High com 8 GPUs)
Se você precisar executar treinamentos distribuídos em grande escala ou disponibilizar modelos de fronteira em vários hosts com tabelas de conjuntos de dados grandes, use a série de máquinas A3 para minimizar a latência de rede de host para host.
A3 Ultra
| GPUs NVIDIA H200 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Contagem de vCPU1 | Memória da instância (GB) | SSD local anexado (GiB) | Contagem de NICs físicas | Largura de banda máxima da rede (Gbps)2 | Contagem de GPUs | Memória da GPU3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2.952 | 12.000 | 10 | 3.600 | 8 | 1128 |
A3 Mega
| GPUs NVIDIA H100 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Contagem de vCPU1 | Memória da instância (GB) | SSD local anexado (GiB) | Contagem de NICs físicas | Largura de banda máxima da rede (Gbps)2 | Contagem de GPUs | Memória da GPU3 (GB HBM3) |
a3-megagpu-8g |
208 | 1.872 | 6.000 | 9 | 1.800 | 8 | 640 |
A3 Alto
| GPUs NVIDIA H100 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Contagem de vCPU1 | Memória da instância (GB) | SSD local anexado (GiB) | Contagem de NICs físicas | Largura de banda máxima da rede (Gbps)2 | Contagem de GPUs | Memória da GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1.500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3.000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1.872 | 6.000 | 5 | 1.000 | 8 | 640 |
1Uma vCPU é implementada como um único hyper-thread de hardware em uma das
plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores.
Para mais informações sobre a largura de banda da rede,
consulte Largura de banda da rede.
3A memória da GPU é a memória em um dispositivo de GPU que pode ser usada para
armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.
Aquisição de capacidade
A aquisição de capacidade de computação para GPUs em cluster exige coordenação para gerenciar a oferta e a demanda de aceleradores de alto desempenho. Como esses recursos estão fisicamente localizados em estruturas de rede especializadas, é necessário solicitá-los por fluxos de trabalho gerenciados.
É possível reservar capacidade pela equipe da conta ou usar reservas futuras e o Dynamic Workload Scheduler.
A seguir
- Para saber como adquirir capacidade, consulte Opções de consumo.
- Para avaliar os requisitos de infraestrutura, consulte Escolher uma infraestrutura.
- Para planejar a topologia de rede, consulte Requisitos de rede de GPU para ambientes em cluster.
- Para reservar recursos de computação, consulte Reservar capacidade.