As unidades de processamento gráfico (GPUs) são aceleradores de hardware especializados projetados para processar cargas de trabalho paralelas simultaneamente. No Google Cloud, é possível anexar GPUs NVIDIA a instâncias do Compute Engine e instâncias bare metal para acelerar cargas de trabalho exigentes, como treinamento de inteligência artificial (IA) e machine learning (ML), computação de alto desempenho (HPC), renderização de gráficos e transcodificação de vídeo.
Este documento apresenta uma visão geral das GPUs no Google Cloud, incluindo modelos de GPU disponíveis, mapeamentos de séries de máquinas, características de desempenho, casos de uso ideais e considerações de preços.
O que é uma GPU?
Uma GPU é um processador massivamente paralelo que foi originalmente projetado para gráficos de computador e evoluiu para um mecanismo de computação essencial para IA, ML e computação científica. Ao contrário das unidades centrais de processamento (CPUs), que contêm alguns núcleos potentes otimizados para processamento sequencial de uma única linha de execução, as GPUs consistem em milhares de núcleos menores e altamente eficientes projetados para realizar cálculos matemáticos simultaneamente em grandes conjuntos de dados.
Os principais componentes arquitetônicos de um sistema de GPU são:
Núcleos CUDA: unidades de processamento de vetores de uso geral que executam instruções em várias linhas de execução paralelas simultaneamente usando uma arquitetura de instrução única, várias linhas de execução (SIMT). Os núcleos CUDA processam cálculos vetoriais e de usar pontos flutuantes padrão (como FP32 e FP64), além de renderização de gráficos gerais e simulações físicas.
Tensor Cores: unidades de processamento especializadas de multiplicação e acumulação de matrizes (MMA) projetadas para acelerar cálculos de redes neurais. Os Tensor Cores oferecem acelerações exponenciais para treinamento e inferência de IA em formatos de precisão numérica especializados, incluindo FP4, FP8, INT8, TF32 e FP16/BF16.
Memória de alta largura de banda: memória dedicada no dispositivo que oferece até vários terabytes por segundo (TBps) de largura de banda, como memória de alta largura de banda (HBM) ou taxa de dados dupla de gráficos (GDDR). Essa alta capacidade de processamento mantém milhares de núcleos de GPU abastecidos com dados durante operações intensivas de matriz.
Interconexões de alta velocidade (NVLink e NVSwitch): tecnologias de interconexão de alta largura de banda e baixa latência que conectam várias GPUs no mesmo servidor ou em vários nós. O NVLink oferece comunicação direta entre GPUs que ignora o barramento PCIe mais lento, permitindo que clusters de GPUs funcionem como um único pool de memória de acelerador coerente.
Software de estação de trabalho virtual (NVIDIA RTX vWS): software empresarial que oferece aceleração gráfica virtualizada para estações de trabalho visuais remotas, design assistido por computador (CAD), criação de conteúdo digital e modelagem 3D.
Modelos de GPU e séries de máquinas
Google Cloud oferece GPUs NVIDIA em várias gerações para atender a diferentes necessidades de carga de trabalho e orçamento. No Compute Engine, as GPUs estão disponíveis como séries de máquinas otimizadas para aceleradores pré-configuradas (séries A e G) ou como aceleradores anexáveis nas séries de máquinas N1 de uso geral.
A tabela a seguir resume as especificações de hardware, os mapeamentos de séries de máquinas, a largura de banda de rede e os recursos de armazenamento dos modelos de GPU disponíveis no Compute Engine:
| Modelo de GPU | Série de máquina | Arquitetura | Memória e largura de banda da GPU | GPUs por instância de computação | Largura de banda máxima da rede | SSD local | Interconexão | Compatibilidade com NVIDIA RTX Virtual Workstation (vWS) |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | 279 GB HBM3e (8 TBps) | 4 (NVL72) | 3.600 Gbps | 12.000 GiB | NVLink Full Mesh (1.800 GBps) | Não |
| NVIDIA GB200 | A4X | Blackwell | 186 GB HBM3e (8 TBps) | 4 (NVL72) | 2.000 Gbps | 12.000 GiB | NVLink Full Mesh (1.800 GBps) | Não |
| NVIDIA B200 | A4 | Blackwell | 180 GB HBM3e (8 TBps) | 8 | 3.600 Gbps | 12.000 GiB | NVLink Full Mesh (1.800 GBps) | Não |
| NVIDIA H200 | A3 Ultra | Funil | 141 GB HBM3e (4,8 TBps) | 8 | 3.600 Gbps | 12.000 GiB | Malha completa NVLink (900 GBps) | Não |
| NVIDIA H100 | A3 Mega, High, Edge | Funil | 80 GB HBM3 (3,35 TBps) | 1, 2, 4, 8 | Até 1.000 Gbps | Até 6.000 GiB | Malha completa NVLink (900 GBps) | Não |
| NVIDIA A100 (80 GB) | A2 Ultra | Ampere | 80 GB HBM2e (1,9 TBps) | 1, 2, 4, 8 | 100 Gbps | Até 3.000 GiB | NVLink Full Mesh (600 GBps) | Não |
| NVIDIA A100 (40 GB) | A2 Standard | Ampere | 40 GB HBM2 (1,6 TBps) | 1, 2, 4, 8, 16 | 100 Gbps | Até 3.000 GiB | NVLink Full Mesh (600 GBps) | Não |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96 GB GDDR7 (1,597 TBps) | 1/8, 1/4, 1/2, 1, 2, 4, 8 | 200 Gbps | Até 3.000 GiB | PCIe Gen 5 | Sim |
| NVIDIA L4 | G2 | Ada Lovelace | 24 GB GDDR6 (300 GBps) | 1, 2, 4, 8 | 100 Gbps | Até 3.000 GiB | PCIe Gen 4 | Sim |
| NVIDIA T4 (fim do suporte) |
N1+T4 | Turing | 16 GB GDDR6 (320 GBps) | 1, 2, 4 | 100 Gbps | Com suporte | PCIe Gen 3 | Sim |
| NVIDIA V100 | N1+V100 | Volta | 16 GB HBM2 (900 GBps) | 1, 2, 4, 8 | 100 Gbps | Com suporte | NVLink Ring (300 GBps) | Não |
| NVIDIA P100 (próximo ao fim do suporte) |
N1+P100 | Pascal | 16 GB HBM2 (732 GBps) | 1, 2, 4 | 100 Gbps | Com suporte | PCIe Gen 3 | Sim |
| NVIDIA P4 (fim do suporte) |
N1+P4 | Pascal | 8 GB GDDR5 (192 GBps) | 1, 2, 4 | 100 Gbps | Com suporte | PCIe Gen 3 | Sim |
Características de desempenho da GPU
A escolha do modelo de GPU certo depende das características computacionais, dos requisitos de memória, dos formatos de precisão e das necessidades de escalonabilidade da sua carga de trabalho.
Casos de uso ideais e requisitos de carga de trabalho
As GPUs aceleram diversas cargas de trabalho computacionais em IA, computação visual e modelagem científica. Para entender os requisitos arquitetônicos de cada categoria de carga de trabalho, selecione uma das seguintes guias:
Treinamento com IA/ML
Modelos de base do Frontier e mistura de especialistas (MoE): o pré-treinamento de modelos transformer massivos, arquiteturas multimodais e redes de mistura de especialistas (MoE) exige alta capacidade de processamento de Tensor Core, grandes capacidades de memória de alta largura de banda (HBM) (até 279 GB por GPU) e largura de banda de interconexão NVLink de velocidade ultrarrápida (até 1.800 GBps) para minimizar a latência de sincronização de vários nós. Série de máquinas recomendada:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
Para mais informações, consulte Recomendações para modelos de pré-treinamento na documentação do Hipercomputador de IA.
Ajuste fino e treinamento moderado de modelos: adaptar modelos de fundação atuais usando técnicas como ajuste fino com eficiência de parâmetros (PEFT) e adaptação de classificação baixa (LoRA) exige memória de GPU suficiente para manter pesos e gradientes do modelo sem exigir clustering multinó de exaescala. Série de máquinas recomendada:
Para mais informações, consulte Recomendações para ajuste refinado de modelos na documentação do Hipercomputador de IA.
Inferência de IA/ML
Inferência de modelos grandes (mais de 70 bilhões de parâmetros): a veiculação de modelos de linguagem grandes (LLMs) se beneficia da alta capacidade de memória de alta largura de banda (HBM3e) (141 a 186 GB por GPU) para ajustar as ponderações do modelo em menos GPUs, reduzindo o overhead de comunicação entre chips. Série de máquinas recomendada:
Serviços de alta capacidade de processamento e em tempo real: consultas interativas de baixa latência, respostas de streaming e geração de imagens usam formatos numéricos quantizados acelerados por hardware, como usar pontos flutuantes de 8 bits (FP8), inteiro de 8 bits (INT8) e inteiro de 4 bits (INT4), para maximizar a capacidade de processamento de solicitações por dólar. Série de máquinas recomendada:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge e High (NVIDIA H100)
Para mais informações, consulte Recomendações para veiculação de inferência na documentação do Hipercomputador de IA.
Gráficos e computação visual
CAD 3D, gêmeos digitais e estações de trabalho virtuais: modelagem 3D interativa, projeto assistido por computador (CAD), renderização arquitetônica e gêmeos digitais (como o NVIDIA Omniverse) usam núcleos de traçado de raio (RT) dedicados e estações de trabalho virtuais (vWS) NVIDIA RTX para estações de trabalho visuais remotas e GPUs virtuais fracionadas (vGPUs). Série de máquinas recomendada:
Processamento e transcodificação de vídeo: os pipelines de transmissão ao vivo, a transcodificação de vídeo e o processamento de mídia usam hardware dedicado NVIDIA Encoder (NVENC) e NVIDIA Decoder (NVDEC), mecanismos de vídeo compatíveis com os codecs AV1, High Efficiency Video Coding (HEVC) e H.264. Série de máquinas recomendada:
HPC e simulação
Simulação e modelagem científica: aplicativos em dinâmica molecular (como GROMACS e AMBER), dinâmica de fluidos computacional (CFD), química quântica, astrofísica e previsão do tempo exigem alta performance de ponto flutuante de dupla precisão de 64 bits (FP64) e alta largura de banda de memória. Série de máquinas recomendada:
Para mais informações, consulte Recomendações para HPC na documentação do Hipercomputador de IA.
Considerações sobre carga de trabalho
As GPUs geralmente não são adequadas para as seguintes cargas de trabalho:
- Lógica sequencial e de uma única linha de execução: tarefas dominadas por ramificações de decisão sequenciais ou pipelines de execução em série têm melhor desempenho em CPUs com altas frequências de clock de núcleo único.
- Aplicativos da Web e microsserviços padrão: servidores da Web de uso geral, sistemas de gerenciamento de bancos de dados relacionais (RDBMS) e back-ends de API padrão sem requisitos de IA ou processamento de gráficos não se beneficiam da aceleração de GPU. Essas cargas de trabalho são hospedadas de maneira mais econômica em instâncias de CPU de uso geral ou otimizadas para computação.
- Cargas de trabalho otimizadas para XLA e frameworks compilados em gráficos: se os modelos de aprendizado profundo forem criados usando frameworks como JAX, PyTorch/XLA ou TensorFlow, eles poderão aproveitar as otimizações de gráficos orientadas por compilador (XLA). Se os modelos também se beneficiarem de matrizes sistólicas personalizadas e comutação de circuito óptico, avalie arquiteturas de aceleradores alternativas projetadas para esses paradigmas de execução específicos.
Considerações de preço
Os seguintes fatores determinam o preço da GPU no Google Cloud:
O modelo específico da GPU.
O número de GPUs anexadas.
Recursos provisionados, como vCPUs, memória do sistema e armazenamento.
O modelo de consumo que você seleciona.
As seções a seguir descrevem os modelos de consumo e as opções de desconto disponíveis para GPUs no Google Cloud.
Modelos de consumo e compra
É possível provisionar instâncias de GPU usando várias opções de consumo, dependendo dos requisitos de disponibilidade e da tolerância a custos:
Sob demanda: preços padrão de pagamento por uso (PAYG) faturados por segundo sem compromisso de longo prazo. As instâncias sob demanda oferecem flexibilidade completa de ciclo de vida para desenvolvimento, testes e cargas de trabalho de produção variáveis.
VMs spot: instâncias de computação com grandes descontos (até 60 a 91% de desconto nas taxas sob demanda) que usam o excedente da capacidade doGoogle Cloud . Como Google Cloud pode interromper ou excluir VMs spot para recuperar capacidade com um aviso de 30 segundos, essas instâncias de computação são ideais para treinamento em lote de ML tolerante a falhas, jobs em lote com checkpoint e processamento de dados distribuído.
VMs flex-start: opção de programação dinâmica com tecnologia do Dynamic Workload Scheduler (DWS) que provisiona recursos de GPU em um período especificado para cargas de trabalho de duração fixa (até 7 dias) a preços com desconto.
Reservas:
- Reservas: é possível reservar capacidade para GPUs padrão e usar imediatamente a capacidade reservada.
- Reservas adiantadas (modo de calendário e AI Hypercomputer): é possível solicitar a reserva de capacidade de GPU em cluster para uma data e hora futuras. Se Google Cloud aprovar sua solicitação, você poderá começar a usar a capacidade no horário especificado e manter o acesso exclusivo até o término da reserva.
Opções de desconto
Descontos por compromisso de uso (CUDs): oferecem descontos substanciais (até 55% para compromissos de três anos ou 37% para compromissos de um ano) em troca de um compromisso de manter um nível contínuo de uso de recursos em uma região específica. Para tipos de máquina otimizados para aceleradores e GPUs anexadas, os CUDs exigem a compra de compromissos baseados em recursos anexados a reservas.
Descontos por uso prolongado (SUDs): descontos automáticos aplicados a instâncias de computação N1 e GPUs anexadas quando elas são executadas por mais de 25% de um mês de faturamento. As séries de máquinas otimizadas para aceleradores (séries A e G) não recebem SUDs.
Para preços detalhados por hora e mensais em todas as regiões, consulte a página de preços de GPU e a página de preços de instâncias de VM.
Para uma matriz de recursos detalhada da disponibilidade de opções de consumo em todos os tipos de máquinas com aceleradores, consulte Disponibilidade de opções de consumo por tipo de máquina.
A seguir
- Conheça as máquinas com GPU na família de máquinas com otimização para aceleradores.
- Saiba como criar uma VM com GPUs anexadas.
- Conheça a arquitetura de supercomputação de IA do Google Cloudna visão geral do Hipercomputador de IA.