Sobre aceleradores de GPU

O Hipercomputador de IA oferece uma infraestrutura integrada verticalmente otimizada para cargas de trabalho exigentes de inteligência artificial (IA) e machine learning (ML). As GPUs NVIDIA de alta performance são categorizadas de acordo com a forma como o sistema processa os eventos de ciclo de vida e a manutenção delas: GPUs gerais e GPUs em cluster.

Para identificar a categoria de infraestrutura ideal para sua carga de trabalho, consulte Escolher a infraestrutura do acelerador.

GPUs gerais

As GPUs gerais são gerenciadas como unidades de computação independentes, usando APIs padrão do Compute Engine e do Google Kubernetes Engine (GKE) para integração direta com Google Cloudo plano de controle.

As GPUs gerais incluem as seguintes séries de máquinas:

  • A3 High com 1, 2 ou 4 GPUs (NVIDIA H100): otimizada para cargas de trabalho de treinamento e inferência padrão que não exigem um cluster sincronizado de 8 GPUs.
  • A3 Edge (NVIDIA H100): otimizada para inferência distribuída em vários hosts com alta capacidade de processamento usando a rede VPC padrão.
  • A2 (NVIDIA A100): otimizada para disponibilização de nó único de alta performance e ajuste fino em pequena escala.
  • G4 (NVIDIA RTX PRO 6000): otimizada para inferência e cargas de trabalho gráficas de nível básico econômicas.
  • G2 (NVIDIA L4): otimizada para inferência e RAG convencionais.
  • N1 (NVIDIA T4 ou V100): otimizada para inferência de nível básico e tarefas de pesquisa que priorizam o custo em vez de interconexões de alta performance.

GPUs em cluster

As GPUs em cluster são gerenciadas como um único sistema fortemente acoplado de milhares de aceleradores interconectados usando o Cluster Director.

As GPUs em cluster incluem as seguintes séries de máquinas:

Considerações sobre a performance da GPU

Para avaliar e otimizar a performance da carga de trabalho, é possível acompanhar métricas de hardware, como a utilização do núcleo CUDA e do Tensor Core. Para monitorar seus recursos e avaliar a performance em ambientes gerais e em cluster, consulte o seguinte:

  • Painéis de monitoramento: acompanhe a utilização da GPU e o uso da memória em tempo real para instâncias independentes individuais ou frotas de clusters orquestradas.
  • Receitas de métricas de taxa de transferência útil: medem a porcentagem de tempo em que os aceleradores realizam computação útil em comparação com a sobrecarga do sistema, o que é altamente recomendado para treinamento distribuído em grande escala em hardware em cluster.

A seguir