Escolher entre GPUs gerais e em cluster

Este documento oferece recomendações sobre os aceleradores, as opções de consumo e as ferramentas de implantação mais adequadas para diferentes cargas de trabalho de inteligência artificial (IA), machine learning (ML) e computação de alto desempenho (HPC). Use este documento para identificar a melhor implantação para sua carga de trabalho.

Para informações e recomendações sobre os pilares da infraestrutura para cargas de trabalho de IA, ML e HPC, consulte os seguintes documentos:

Visão geral das cargas de trabalho

A arquitetura do Hipercomputador de IA oferece suporte aos seguintes casos de uso:

Carga de trabalho Descrição Recomendação
Pré-treinamento de modelos de fundação Isso envolve a criação de um modelo de linguagem usando um grande conjunto de dados. O resultado do pré-treinamento de modelos de fundação é um novo modelo que é bom em realizar tarefas gerais.
Os modelos são categorizados com base no tamanho da seguinte forma:
  • Modelo de fronteira: modelos de ML que abrangem centenas de bilhões a trilhões de parâmetros ou mais. Isso inclui modelos de linguagem grandes (LLMs) como o Gemini.
  • Modelo grande:modelos de ML que abrangem dezenas a centenas de bilhões de parâmetros ou mais.
Consulte recomendações para modelos de pré-treinamento
Ajuste de detalhes Isso envolve pegar um modelo treinado e adaptá-lo para realizar tarefas específicas usando conjuntos de dados especializados ou outras técnicas. O ajuste geralmente é realizado em modelos grandes. Confira recomendações para ajuste fino de modelos
Inferência ou disponibilização Isso envolve pegar um modelo treinado ou ajustado e disponibilizá-lo para consumo por usuários ou aplicativos.
As cargas de trabalho de inferência são categorizadas com base no tamanho dos modelos da seguinte maneira:
  • Inferência para modelos de fundação em vários hosts: realizando inferência com modelos de ML treinados que abrangem centenas de bilhões a trilhões de parâmetros ou mais. Para essas cargas de trabalho de inferência, a carga computacional é compartilhada entre várias máquinas host.
  • Inferência de modelo de fundação de host único: execução de inferência com modelos de ML treinados que abrangem dezenas a centenas de bilhões de parâmetros. Para essas cargas de trabalho de inferência, a carga computacional fica confinada a uma única máquina host.
  • Inferência de modelos grandes:realizar inferência com modelos de ML treinados ou refinados que abrangem dezenas a centenas de bilhões de parâmetros.
Consulte recomendações para inferência.
ML para modelos pequenos ou médios Isso envolve treinar e disponibilizar modelos de ML menores em tamanho e complexidade, geralmente para tarefas mais especializadas. Confira recomendações de ML para modelos pequenos ou médios
HPC Essa é a prática de agregar recursos de computação para conseguir um desempenho maior do que o de uma única estação de trabalho, servidor ou computador. A HPC é usada para resolver problemas na pesquisa acadêmica, ciência, design, simulação e Business Intelligence. Consulte recomendações para HPC

Recomendações para modelos de pré-treinamento

Para pré-treinar modelos de fundação, grandes clusters de aceleradores leem continuamente grandes volumes de dados. Esses aceleradores ajustam os pesos usando transmissões diretas e indiretas para aprender com os dados. Esses jobs de treinamento são executados por semanas ou até meses de cada vez.

As seções a seguir descrevem os aceleradores e as opções de consumo que recomendamos usar para pré-treinar modelos de base.

Aceleradores recomendados

Para pré-treinar modelos de fundação no Google Cloud, recomendamos usar tipos de máquina otimizados para aceleradores A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB) e usar um orquestrador para implantar o cluster.

Para implantar esses clusters de aceleradores, também recomendamos usar o Cluster Director ou o Cluster Toolkit. Para mais informações, consulte o guia de implantação de cluster respectivo para o tipo de máquina escolhido na tabela a seguir.

Cargas de trabalho Recomendações Guia de implantação de cluster
Tipo de máquina Orquestrador
Pré-treinamento de modelos de fundação
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Criar um cluster do GKE otimizado para IA com configuração padrão
Slurm
Treinamento de modelo grandes A3 Ultra (NVIDIA H200 141GB) GKE Criar um cluster do GKE otimizado para IA com configuração padrão
Slurm
Treinamento de modelo grandes
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE Maximizar a largura de banda da rede GPU em clusters do modo Standard
Slurm

Opção de consumo recomendada

Para ter um alto nível de garantia na obtenção de grandes clusters de aceleradores, recomendamos usar uma reserva. Especificamente, para minimizar os custos dos recursos reservados, recomendamos que você solicite uma duração de reserva longa o suficiente para receber descontos por uso contínuo. Para mais informações sobre as opções de consumo, consulte Escolher uma opção de consumo.

Recomendações para ajuste fino de modelos

Para ajustar modelos de fundação grandes, clusters menores de aceleradores leem volumes moderados de dados. Esses aceleradores ajustam o modelo para realizar tarefas específicas. Esses jobs de ajuste fino são executados por dias ou até semanas.

As seções a seguir descrevem os aceleradores e a opção de consumo recomendados para usar ao ajustar modelos.

Para ajustar modelos no Google Cloud, recomendamos usar tipos de máquina otimizados para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB) e usar um orquestrador para implantar o cluster.

Para implantar esses clusters de aceleradores, também recomendamos usar o Cluster Director ou o Cluster Toolkit. Para mais informações, consulte o guia de implantação de cluster respectivo para o tipo de máquina escolhido na tabela a seguir.

Cargas de trabalho Recomendações Guia de implantação de cluster
Tipo de máquina Orquestrador
Ajuste fino de modelos grandes A3 Ultra (NVIDIA H200 141GB) GKE Criar um cluster do GKE otimizado para IA com configuração padrão
Slurm
Ajuste fino de modelos grandes
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE Maximizar a largura de banda da rede GPU em clusters do modo Standard
Slurm

Opção de consumo recomendada

Para cargas de trabalho de ajuste refinado, use uma reserva adiantada no modo de calendário para provisionar recursos. Para mais informações sobre as opções de consumo, consulte Escolher uma opção de consumo.

Recomendações para inferência

As seções a seguir descrevem os aceleradores e as opções de consumo recomendados para usar ao realizar a inferência.

Aceleradores recomendados

Os aceleradores recomendados para inferência dependem de você estar realizando inferência de fronteira multi-host ou de modelo grande, ou inferência de fronteira de host único.

Aceleradores recomendados (vários hosts)

Para realizar inferência de modelos grandes ou de fronteira em vários hosts no Google Cloud, use um tipo de máquina otimizado para acelerador A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB) e implante a máquina usando um orquestrador. Para implantar esses clusters de aceleradores, também recomendamos usar o Cluster Director ou o Cluster Toolkit. A tabela fornece links para guias de implantação de cluster para cada tipo de máquina recomendado.

Cargas de trabalho Recomendações Guia de implantação de cluster
Tipo de máquina Orquestrador
Inferência de fronteira de vários hosts
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Criar um cluster do GKE otimizado para IA com configuração padrão
Slurm
Inferência de modelos grandes A3 Ultra (NVIDIA H200 141GB) GKE Criar um cluster do GKE otimizado para IA com configuração padrão
Slurm
Inferência de modelos grandes
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE Maximizar a largura de banda da rede GPU em clusters do modo Standard
Slurm

Aceleradores recomendados (host único)

A tabela descreve os aceleradores que recomendamos usar para realizar inferência de fronteira de host único. A tabela fornece links para guias de implantação de VM para cada tipo de máquina recomendado.

Cargas de trabalho Recomendações Guia de implantação de VMs
Tipo de máquina Orquestrador
Inferência de fronteira e convencional de host único
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141GB)
N/A Criar uma instância A4 ou A3 Ultra
  • A3 High (NVIDIA H100 80GB)
  • A3 Edge (NVIDIA H100 80GB)
Criar uma instância A3 High ou A3 Edge
G4 (NVIDIA RTX PRO 6000) Criar uma instância G4
A2 (NVIDIA A100) Criar uma instância A2
G2 (NVIDIA L4) Criar uma instância G2
N1 (NVIDIA T4 ou V100) Criar uma instância N1

Opção de consumo recomendada

Para inferência, use uma reserva de longa duração ou uma reserva adiantada no modo de calendário. Para mais informações sobre as opções de consumo, consulte Escolher uma opção de consumo.

Recomendações para modelos pequenos ou médios

Para cargas de trabalho de ML que envolvem modelos de pequeno a médio porte, alcançar um equilíbrio ideal entre preço e desempenho é uma consideração principal.

Aceleradores recomendados

A tabela a seguir descreve os aceleradores recomendados para cargas de trabalho de ML de modelos pequenos a médios.

Cargas de trabalho Recomendações Guia de implantação de VMs
Tipo de máquina Orquestrador
ML para modelos pequenos ou médios G4 (NVIDIA RTX PRO 6000) N/A Criar uma instância G4
G2 (NVIDIA L4) Criar uma instância G2
A2 (NVIDIA A100) Criar uma instância A2
A3 Edge (NVIDIA H100 80GB) Criar uma instância do A3 Edge
N1 (NVIDIA T4 ou V100) Criar uma instância N1

Recomendações para HPC

Para cargas de trabalho de HPC, qualquer série de máquinas otimizada para aceleradores ou série de máquinas otimizada para computação funciona bem. Se você estiver usando uma série de máquinas otimizadas para aceleradores, a melhor opção vai depender da quantidade de computação que precisa ser transferida para a GPU. Para uma lista detalhada de recomendações para cargas de trabalho de HPC, consulte Práticas recomendadas para executar cargas de trabalho de HPC.

Resumo das recomendações

A tabela a seguir resume os aceleradores e as opções de consumo recomendados para cada carga de trabalho.

Recurso Recomendação
Pré-treinamento de modelos
Família de máquinas Use um dos seguintes tipos de máquina otimizados para aceleradores: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB).
Opção de consumo 'Usar reservas adiantadas padrão
Ajuste fino de modelos
Família de máquinas Use os tipos de máquina otimizados para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB).
Opção de consumo 'Usar reservas adiantadas padrão
Inferência
Família de máquinas Use um dos seguintes tipos de máquina: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), A3 High (NVIDIA H100 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) ou N1 (NVIDIA T4 ou V100).
Opção de consumo Usar reservas, sob demanda ou spot
ML para modelos pequenos ou médios
Família de máquinas Use um dos seguintes tipos de máquina: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) ou N1 (NVIDIA T4 ou V100).
Opção de consumo Usar reservas sob demanda, spot ou padrão
Armazenamento Usar o Cloud Storage FUSE
HPC
Consulte a seção de resumo das práticas recomendadas para executar cargas de trabalho de HPC.

A seguir