Visão geral das GPUs

As GPUs de uso geral são otimizadas para cargas de trabalho de inteligência artificial (IA) e machine learning (ML) que priorizam flexibilidade operacional, independência de recursos e custo-benefício.

As GPUs gerais permitem que as equipes implantem e escalonem aceleradores NVIDIA com total autonomia operacional, evitando a complexidade arquitetônica dos clusters de supercomputação coordenados. Eles são ideais para cargas de trabalho que priorizam alta disponibilidade, provisionamento de autoatendimento e escalonamento independente. Os casos de uso comuns incluem inferência em tempo real, RAG, prototipagem e treinamento de modelo pequenos a médios.

Principais características das GPUs gerais

  • Flexibilidade operacional: é possível gerenciar recursos usando interfaces padrão do GKE (Autopilot e Standard) e do Compute Engine para simplificar a implantação e o escalonamento.
  • Alta disponibilidade: Google Cloud atualiza instâncias individuais de forma independente para garantir que as atualizações em um nó não afetem a disponibilidade de outros, permitindo que o balanceador de carga redirecione o tráfego sem interromper as frotas de serviço.
  • Simplicidade de rede: suas cargas de trabalho usam serviços padrão de nuvem privada virtual (VPC) e TCP/IP padrão em interfaces de rede virtual (gVNIC) do Google para eliminar estruturas complexas no nível do hardware.
  • Otimização de custos: use VMs spot para pesquisas tolerantes a falhas e economize até 90% em comparação com as taxas padrão sob demanda.
  • Aquisição por autoatendimento: é possível adquirir capacidade diretamente por reservas padrão e solicitações sob demanda sem precisar de fluxos de trabalho gerenciados pela equipe de contas.

Famílias gerais de GPUs e especificações técnicas

Analise as cargas de trabalho e as especificações de hardware para a série de máquinas de GPU geral. Para veiculação de alta capacidade, use a série A3 Edge.

Série A3 (High com 1, 2 ou 4 GPUs e Edge)

A3 High (1, 2 ou 4 GPUs)

Se você estiver executando cargas de trabalho de inferência ou treinamento padrão que exigem alto desempenho, mas não precisam de um cluster sincronizado completo de oito GPUs, use a série de máquinas A3 High com uma, duas ou quatro GPUs anexadas.

Os tipos de máquina A3 High têm GPUs NVIDIA H100 SXM e são adequados para inferência de modelos grandes e ajuste fino de modelos.

GPUs NVIDIA H100 anexadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1.500 1 50 2 160
a3-highgpu-4g 104 936 3.000 1 100 4 320
a3-highgpu-8g 208 1.872 6.000 5 1.000 8 640

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre largura de banda de rede, consulte Largura de banda de rede.
3A memória da GPU é a memória em um dispositivo GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

A3 Edge

Se você estiver executando cargas de trabalho de inferência distribuída de alta capacidade em vários hosts sem uma estrutura de cluster coordenada, use a série A3 Edge para simplificar a implantação em redes privadas virtuais padrão.

Os tipos de máquina A3 Edge têm GPUs NVIDIA H100 SXM e são projetados especificamente para veiculação. Eles estão disponíveis em um conjunto limitado de regiões.

GPUs NVIDIA H100 anexadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Contagem de NICs físicas Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM3)
a3-edgegpu-8g 208 1.872 6.000 5
  • 600: para asia-south1 e northamerica-northeast2
  • 400: para todas as outras regiões do A3 Edge
8 640

Série A2 (padrão e ultra)

Se você precisar realizar a veiculação de modelos de alto desempenho em um único nó ou o ajuste fino de modelos em pequena escala, use a série de máquinas A2 para acessar recursos dedicados de GPU NVIDIA A100.

A2 Ultra

GPUs NVIDIA A100 de 80 GB anexadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD local anexado (GiB) Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1.500 50 4 320
a2-ultragpu-8g 96 1.360 3.000 100 8 640

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre largura de banda de rede, consulte Largura de banda de rede.
3A memória da GPU é a memória em um dispositivo GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

A2 Padrão

GPUs NVIDIA A100 de 40 GB anexadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) Compatível com SSD local Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3
(GB HBM2)
a2-highgpu-1g 12 85 Sim 24 1 40
a2-highgpu-2g 24 170 Sim 32 2 80
a2-highgpu-4g 48 340 Sim 50 4 160
a2-highgpu-8g 96 680 Sim 100 8 320
a2-megagpu-16g 96 1.360 Sim 100 16 640

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre largura de banda de rede, consulte Largura de banda de rede.
3A memória da GPU é a memória em um dispositivo GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

G4 series

Se sua equipe precisar de inferência básica econômica ou cargas de trabalho de renderização de gráficos padrão, use a série de máquinas G4 com GPUs NVIDIA RTX PRO 6000.

Os tipos de máquina G4 usam GPUs NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000) e são adequados para cargas de trabalho de simulação do NVIDIA Omniverse, aplicativos com muitos gráficos, transcodificação de vídeo e desktops virtuais. Os tipos de máquina G4 também oferecem uma solução de baixo custo para realizar inferência de host único e ajuste de modelo em comparação com os tipos de máquina da série A.

GPUs NVIDIA RTX PRO 6000 anexadas
Tipo de máquina Contagem de vCPU1 Memória da instância (GB) SSD Titanium máximo compatível (GiB)2 Contagem de NICs físicas Largura de banda máxima da rede (Gbps)3 Contagem de GPUs Memória da GPU4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1.500 1 50 1 96
g4-standard-96 96 360 3.000 1 100 2 192
g4-standard-192 192 720 6.000 1 200 4 384
g4-standard-384 384 1,440 12.000 2 400 8 768

*A memória da GPU é a memória disponível em um dispositivo GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho aceleradas, como machine learning e cargas de trabalho com uso intensivo de gráficos.

série G2

Se você estiver implantando aplicativos de inferência em tempo real convencionais ou pipelines de geração aumentada por recuperação (RAG, na sigla em inglês), use a série de máquinas G2 para equilibrar o desempenho e a eficiência de custo com GPUs NVIDIA L4.

GPUs NVIDIA L4 anexadas
Tipo de máquina Contagem de vCPU1 Memória padrão da instância (GB) Intervalo de memória personalizada da instância (GB) Suporte máximo para SSD local (GiB) Largura de banda máxima da rede (Gbps)2 Contagem de GPUs Memória da GPU3 (GB GDDR6)
g2-standard-4 4 16 16 a 32 375 10 1 24
g2-standard-8 8 32 32 a 54 375 16 1 24
g2-standard-12 12 48 48 a 54 375 16 1 24
g2-standard-16 16 64 54 a 64 375 32 1 24
g2-standard-24 24 96 96 a 108 750 32 2 48
g2-standard-32 32 128 96 a 128 375 32 1 24
g2-standard-48 48 192 192 a 216 1.500 50 4 96
g2-standard-96 96 384 384 a 432 3.000 100 8 192

1Uma vCPU é implementada como um único hyper-thread de hardware em uma das plataformas de CPU disponíveis.
2A largura de banda de saída máxima não pode exceder o número informado. A largura de banda de saída real depende do endereço IP de destino e de outros fatores. Para mais informações sobre largura de banda de rede, consulte Largura de banda de rede.
3A memória da GPU é a memória em um dispositivo GPU que pode ser usada para armazenamento temporário de dados. Ela é separada da memória da instância e foi projetada especificamente para lidar com as demandas de largura de banda mais altas das cargas de trabalho com uso intensivo de gráficos.

Série N1 (NVIDIA T4 ou V100)

Se a prioridade for experimentos sensíveis a custos ou execução de inferência de baixa simultaneidade e nível básico, use a série de máquinas N1 para anexar GPUs NVIDIA T4 ou V100.

NVIDIA T4

Tipo de acelerador Contagem de GPUs Memória da GPU1 (GB GDDR6) Contagem de vCPU Memória da instância (GB) Compatível com SSD local
nvidia-tesla-t4 ou
nvidia-tesla-t4-vws
1 16 1 a 48 1 a 312 Sim
2 32 1 a 48 1 a 312 Sim
4 64 1 a 96 1 a 624 Sim

NVIDIA V100

Tipo de acelerador Contagem de GPUs Memória da GPU1 (GB HBM2) Contagem de vCPU Memória da instância (GB) SSD local compatível2
nvidia-tesla-v100 1 16 1 a 12 1 a 78 Sim
2 32 1 a 24 1 a 156 Sim
4 64 1 a 48 1 a 312 Sim
8 128 1 a 96 1 a 624 Sim

Aquisição de capacidade

Os aceleradores de GPU gerais usam o provisionamento padrão de autoatendimento. É possível conseguir capacidade com reservas padrão, solicitações on demand ou VMs spot. Como a capacidade on demand pode ficar indisponível, use VMs spot ou início flexível sempre que possível.

A seguir