Entender as GPUs

As unidades de processamento gráfico (GPUs) são aceleradores de hardware especializados projetados para processar cargas de trabalho paralelas simultaneamente. No Google Cloud, é possível anexar GPUs NVIDIA a instâncias do Compute Engine e instâncias bare metal para acelerar cargas de trabalho exigentes, como treinamento de inteligência artificial (IA) e machine learning (ML), computação de alto desempenho (HPC), renderização de gráficos e transcodificação de vídeo.

Este documento apresenta uma visão geral das GPUs no Google Cloud, incluindo modelos de GPU disponíveis, mapeamentos de séries de máquinas, características de desempenho, casos de uso ideais e considerações de preços.

O que é uma GPU?

Uma GPU é um processador massivamente paralelo que foi originalmente projetado para gráficos de computador e evoluiu para um mecanismo de computação essencial para IA, ML e computação científica. Ao contrário das unidades centrais de processamento (CPUs), que contêm alguns núcleos potentes otimizados para processamento sequencial de uma única linha de execução, as GPUs consistem em milhares de núcleos menores e altamente eficientes projetados para realizar cálculos matemáticos simultaneamente em grandes conjuntos de dados.

Os principais componentes arquitetônicos de um sistema de GPU são:

  • Núcleos CUDA: unidades de processamento de vetores de uso geral que executam instruções em várias linhas de execução paralelas simultaneamente usando uma arquitetura de instrução única, várias linhas de execução (SIMT). Os núcleos CUDA processam cálculos vetoriais e de usar pontos flutuantes padrão (como FP32 e FP64), além de renderização de gráficos gerais e simulações físicas.

  • Tensor Cores: unidades de processamento especializadas de multiplicação e acumulação de matrizes (MMA) projetadas para acelerar cálculos de redes neurais. Os Tensor Cores oferecem acelerações exponenciais para treinamento e inferência de IA em formatos de precisão numérica especializados, incluindo FP4, FP8, INT8, TF32 e FP16/BF16.

  • Memória de alta largura de banda: memória dedicada no dispositivo que oferece até vários terabytes por segundo (TBps) de largura de banda, como memória de alta largura de banda (HBM) ou taxa de dados dupla de gráficos (GDDR). Essa alta capacidade de processamento mantém milhares de núcleos de GPU abastecidos com dados durante operações intensivas de matriz.

  • Interconexões de alta velocidade (NVLink e NVSwitch): tecnologias de interconexão de alta largura de banda e baixa latência que conectam várias GPUs no mesmo servidor ou em vários nós. O NVLink oferece comunicação direta entre GPUs que ignora o barramento PCIe mais lento, permitindo que clusters de GPUs funcionem como um único pool de memória de acelerador coerente.

  • Software de estação de trabalho virtual (NVIDIA RTX vWS): software empresarial que oferece aceleração gráfica virtualizada para estações de trabalho visuais remotas, design assistido por computador (CAD), criação de conteúdo digital e modelagem 3D.

Modelos de GPU e séries de máquinas

Google Cloud oferece GPUs NVIDIA em várias gerações para atender a diferentes necessidades de carga de trabalho e orçamento. No Compute Engine, as GPUs estão disponíveis como séries de máquinas otimizadas para aceleradores pré-configuradas (séries A e G) ou como aceleradores anexáveis nas séries de máquinas N1 de uso geral.

A tabela a seguir resume as especificações de hardware, os mapeamentos de séries de máquinas, a largura de banda de rede e os recursos de armazenamento dos modelos de GPU disponíveis no Compute Engine:

Modelo de GPU Série de máquina Arquitetura Memória e largura de banda da GPU GPUs por instância de computação Largura de banda máxima da rede SSD local Interconexão Compatibilidade com NVIDIA RTX Virtual Workstation (vWS)
NVIDIA GB300 A4X Max Blackwell Ultra 279 GB HBM3e (8 TBps) 4 (NVL72) 3.600 Gbps 12.000 GiB NVLink Full Mesh (1.800 GBps) Não
NVIDIA GB200 A4X Blackwell 186 GB HBM3e (8 TBps) 4 (NVL72) 2.000 Gbps 12.000 GiB NVLink Full Mesh (1.800 GBps) Não
NVIDIA B200 A4 Blackwell 180 GB HBM3e (8 TBps) 8 3.600 Gbps 12.000 GiB NVLink Full Mesh (1.800 GBps) Não
NVIDIA H200 A3 Ultra Funil 141 GB HBM3e (4,8 TBps) 8 3.600 Gbps 12.000 GiB Malha completa NVLink (900 GBps) Não
NVIDIA H100 A3 Mega, High, Edge Funil 80 GB HBM3 (3,35 TBps) 1, 2, 4, 8 Até 1.000 Gbps Até 6.000 GiB Malha completa NVLink (900 GBps) Não
NVIDIA A100 (80 GB) A2 Ultra Ampere 80 GB HBM2e (1,9 TBps) 1, 2, 4, 8 100 Gbps Até 3.000 GiB NVLink Full Mesh (600 GBps) Não
NVIDIA A100 (40 GB) A2 Standard Ampere 40 GB HBM2 (1,6 TBps) 1, 2, 4, 8, 16 100 Gbps Até 3.000 GiB NVLink Full Mesh (600 GBps) Não
NVIDIA RTX PRO 6000 G4 Blackwell 96 GB GDDR7 (1,597 TBps) 1/8, 1/4, 1/2, 1, 2, 4, 8 200 Gbps Até 3.000 GiB PCIe Gen 5 Sim
NVIDIA L4 G2 Ada Lovelace 24 GB GDDR6 (300 GBps) 1, 2, 4, 8 100 Gbps Até 3.000 GiB PCIe Gen 4 Sim
NVIDIA T4
(fim do suporte)
N1+T4 Turing 16 GB GDDR6 (320 GBps) 1, 2, 4 100 Gbps Com suporte PCIe Gen 3 Sim
NVIDIA V100 N1+V100 Volta 16 GB HBM2 (900 GBps) 1, 2, 4, 8 100 Gbps Com suporte NVLink Ring (300 GBps) Não
NVIDIA P100
(próximo ao fim do suporte)
N1+P100 Pascal 16 GB HBM2 (732 GBps) 1, 2, 4 100 Gbps Com suporte PCIe Gen 3 Sim
NVIDIA P4
(fim do suporte)
N1+P4 Pascal 8 GB GDDR5 (192 GBps) 1, 2, 4 100 Gbps Com suporte PCIe Gen 3 Sim

Características de desempenho da GPU

A escolha do modelo de GPU certo depende das características computacionais, dos requisitos de memória, dos formatos de precisão e das necessidades de escalonabilidade da sua carga de trabalho.

Casos de uso ideais e requisitos de carga de trabalho

As GPUs aceleram diversas cargas de trabalho computacionais em IA, computação visual e modelagem científica. Para entender os requisitos arquitetônicos de cada categoria de carga de trabalho, selecione uma das seguintes guias:

Treinamento com IA/ML

Inferência de IA/ML

  • Inferência de modelos grandes (mais de 70 bilhões de parâmetros): a veiculação de modelos de linguagem grandes (LLMs) se beneficia da alta capacidade de memória de alta largura de banda (HBM3e) (141 a 186 GB por GPU) para ajustar as ponderações do modelo em menos GPUs, reduzindo o overhead de comunicação entre chips. Série de máquinas recomendada:

  • Serviços de alta capacidade de processamento e em tempo real: consultas interativas de baixa latência, respostas de streaming e geração de imagens usam formatos numéricos quantizados acelerados por hardware, como usar pontos flutuantes de 8 bits (FP8), inteiro de 8 bits (INT8) e inteiro de 4 bits (INT4), para maximizar a capacidade de processamento de solicitações por dólar. Série de máquinas recomendada:

    Para mais informações, consulte Recomendações para veiculação de inferência na documentação do Hipercomputador de IA.

Gráficos e computação visual

HPC e simulação

Considerações sobre carga de trabalho

As GPUs geralmente não são adequadas para as seguintes cargas de trabalho:

  • Lógica sequencial e de uma única linha de execução: tarefas dominadas por ramificações de decisão sequenciais ou pipelines de execução em série têm melhor desempenho em CPUs com altas frequências de clock de núcleo único.
  • Aplicativos da Web e microsserviços padrão: servidores da Web de uso geral, sistemas de gerenciamento de bancos de dados relacionais (RDBMS) e back-ends de API padrão sem requisitos de IA ou processamento de gráficos não se beneficiam da aceleração de GPU. Essas cargas de trabalho são hospedadas de maneira mais econômica em instâncias de CPU de uso geral ou otimizadas para computação.
  • Cargas de trabalho otimizadas para XLA e frameworks compilados em gráficos: se os modelos de aprendizado profundo forem criados usando frameworks como JAX, PyTorch/XLA ou TensorFlow, eles poderão aproveitar as otimizações de gráficos orientadas por compilador (XLA). Se os modelos também se beneficiarem de matrizes sistólicas personalizadas e comutação de circuito óptico, avalie arquiteturas de aceleradores alternativas projetadas para esses paradigmas de execução específicos.

Considerações de preço

Os seguintes fatores determinam o preço da GPU no Google Cloud:

  • O modelo específico da GPU.

  • O número de GPUs anexadas.

  • Recursos provisionados, como vCPUs, memória do sistema e armazenamento.

  • O modelo de consumo que você seleciona.

As seções a seguir descrevem os modelos de consumo e as opções de desconto disponíveis para GPUs no Google Cloud.

Modelos de consumo e compra

É possível provisionar instâncias de GPU usando várias opções de consumo, dependendo dos requisitos de disponibilidade e da tolerância a custos:

  • Sob demanda: preços padrão de pagamento por uso (PAYG) faturados por segundo sem compromisso de longo prazo. As instâncias sob demanda oferecem flexibilidade completa de ciclo de vida para desenvolvimento, testes e cargas de trabalho de produção variáveis.

  • VMs spot: instâncias de computação com grandes descontos (até 60 a 91% de desconto nas taxas sob demanda) que usam o excedente da capacidade doGoogle Cloud . Como Google Cloud pode interromper ou excluir VMs spot para recuperar capacidade com um aviso de 30 segundos, essas instâncias de computação são ideais para treinamento em lote de ML tolerante a falhas, jobs em lote com checkpoint e processamento de dados distribuído.

  • VMs flex-start: opção de programação dinâmica com tecnologia do Dynamic Workload Scheduler (DWS) que provisiona recursos de GPU em um período especificado para cargas de trabalho de duração fixa (até 7 dias) a preços com desconto.

  • Reservas:

    • Reservas: é possível reservar capacidade para GPUs padrão e usar imediatamente a capacidade reservada.
    • Reservas adiantadas (modo de calendário e AI Hypercomputer): é possível solicitar a reserva de capacidade de GPU em cluster para uma data e hora futuras. Se Google Cloud aprovar sua solicitação, você poderá começar a usar a capacidade no horário especificado e manter o acesso exclusivo até o término da reserva.

Opções de desconto

  • Descontos por compromisso de uso (CUDs): oferecem descontos substanciais (até 55% para compromissos de três anos ou 37% para compromissos de um ano) em troca de um compromisso de manter um nível contínuo de uso de recursos em uma região específica. Para tipos de máquina otimizados para aceleradores e GPUs anexadas, os CUDs exigem a compra de compromissos baseados em recursos anexados a reservas.

  • Descontos por uso prolongado (SUDs): descontos automáticos aplicados a instâncias de computação N1 e GPUs anexadas quando elas são executadas por mais de 25% de um mês de faturamento. As séries de máquinas otimizadas para aceleradores (séries A e G) não recebem SUDs.

Para preços detalhados por hora e mensais em todas as regiões, consulte a página de preços de GPU e a página de preços de instâncias de VM.

Para uma matriz de recursos detalhada da disponibilidade de opções de consumo em todos os tipos de máquinas com aceleradores, consulte Disponibilidade de opções de consumo por tipo de máquina.

A seguir