O Hipercomputador de IA oferece uma infraestrutura integrada verticalmente otimizada para cargas de trabalho exigentes de inteligência artificial (IA) e machine learning (ML). As GPUs NVIDIA de alta performance são categorizadas de acordo com a forma como o sistema processa os eventos de ciclo de vida e a manutenção delas: GPUs gerais e GPUs em cluster.
Para identificar a categoria de infraestrutura ideal para sua carga de trabalho, consulte Escolher a infraestrutura do acelerador.
GPUs gerais
As GPUs gerais são gerenciadas como unidades de computação independentes, usando APIs padrão do Compute Engine e do Google Kubernetes Engine (GKE) para integração direta com Google Cloudo plano de controle.
As GPUs gerais incluem as seguintes séries de máquinas:
- A3 High com 1, 2 ou 4 GPUs (NVIDIA H100): otimizada para cargas de trabalho de treinamento e inferência padrão que não exigem um cluster sincronizado de 8 GPUs.
- A3 Edge (NVIDIA H100): otimizada para inferência distribuída em vários hosts com alta capacidade de processamento usando a rede VPC padrão.
- A2 (NVIDIA A100): otimizada para disponibilização de nó único de alta performance e ajuste fino em pequena escala.
- G4 (NVIDIA RTX PRO 6000): otimizada para inferência e cargas de trabalho gráficas de nível básico econômicas.
- G2 (NVIDIA L4): otimizada para inferência e RAG convencionais.
- N1 (NVIDIA T4 ou V100): otimizada para inferência de nível básico e tarefas de pesquisa que priorizam o custo em vez de interconexões de alta performance.
GPUs em cluster
As GPUs em cluster são gerenciadas como um único sistema fortemente acoplado de milhares de aceleradores interconectados usando o Cluster Director.
As GPUs em cluster incluem as seguintes séries de máquinas:
- A4X Max (NVIDIA GB300): projetada para treinamento exaescala bare-metal e computação de alta performance, com Superchips NVIDIA GB300 Grace Blackwell Ultra.
- A4X (NVIDIA GB200) e A4 (NVIDIA B200): projetadas para treinamento de modelo de fundação e treinamento de modelos de fundação exaescala.
- A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100) e A3 High com 8 GPUs (NVIDIA H100): otimizadas para treinamento distribuído em grande escala e inferência de vários hosts envolvendo tabelas de dados enormes.
Considerações sobre a performance da GPU
Para avaliar e otimizar a performance da carga de trabalho, é possível acompanhar métricas de hardware, como a utilização do núcleo CUDA e do Tensor Core. Para monitorar seus recursos e avaliar a performance em ambientes gerais e em cluster, consulte o seguinte:
- Painéis de monitoramento: acompanhe a utilização da GPU e o uso da memória em tempo real para instâncias independentes individuais ou frotas de clusters orquestradas.
- Receitas de métricas de taxa de transferência útil: medem a porcentagem de tempo em que os aceleradores realizam computação útil em comparação com a sobrecarga do sistema, o que é altamente recomendado para treinamento distribuído em grande escala em hardware em cluster.
A seguir
- Para avaliar os requisitos de infraestrutura, consulte Escolher a infraestrutura do acelerador.
- Para analisar o processo e as opções a serem feitas ao iniciar um cluster, consulte Planejar e criar sua infraestrutura de IA.