Este documento oferece recomendações sobre os aceleradores, as opções de consumo e as ferramentas de implantação mais adequadas para diferentes cargas de trabalho de inteligência artificial (IA), machine learning (ML) e computação de alto desempenho (HPC). Use este documento para identificar a melhor implantação para sua carga de trabalho.
Para informações e recomendações sobre os pilares da infraestrutura para cargas de trabalho de IA, ML e HPC, consulte os seguintes documentos:
Visão geral das cargas de trabalho
A arquitetura do Hipercomputador de IA oferece suporte aos seguintes casos de uso:
| Carga de trabalho | Descrição | Recomendação |
|---|---|---|
| Pré-treinamento de modelos de fundação | Isso envolve a criação de um modelo de linguagem usando um grande conjunto de dados. O resultado do pré-treinamento de modelos de fundação é um novo modelo que é bom em realizar tarefas gerais. Os modelos são categorizados com base no tamanho da seguinte forma:
|
Consulte recomendações para modelos de pré-treinamento |
| Ajuste de detalhes | Isso envolve pegar um modelo treinado e adaptá-lo para realizar tarefas específicas usando conjuntos de dados especializados ou outras técnicas. O ajuste geralmente é realizado em modelos grandes. | Confira recomendações para ajuste fino de modelos |
| Inferência ou disponibilização | Isso envolve pegar um modelo treinado ou ajustado e disponibilizá-lo para consumo por usuários ou aplicativos. As cargas de trabalho de inferência são categorizadas com base no tamanho dos modelos da seguinte maneira:
|
Consulte recomendações para inferência. |
| ML para modelos pequenos ou médios | Isso envolve treinar e disponibilizar modelos de ML menores em tamanho e complexidade, geralmente para tarefas mais especializadas. | Confira recomendações de ML para modelos pequenos ou médios |
| HPC | Essa é a prática de agregar recursos de computação para conseguir um desempenho maior do que o de uma única estação de trabalho, servidor ou computador. A HPC é usada para resolver problemas na pesquisa acadêmica, ciência, design, simulação e Business Intelligence. | Consulte recomendações para HPC |
Recomendações para modelos de pré-treinamento
Para pré-treinar modelos de fundação, grandes clusters de aceleradores leem continuamente grandes volumes de dados. Esses aceleradores ajustam os pesos usando transmissões diretas e indiretas para aprender com os dados. Esses jobs de treinamento são executados por semanas ou até meses de cada vez.
As seções a seguir descrevem os aceleradores e as opções de consumo que recomendamos usar para pré-treinar modelos de base.
Aceleradores recomendados
Para pré-treinar modelos de fundação no Google Cloud, recomendamos usar tipos de máquina otimizados para aceleradores A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB) e usar um orquestrador para implantar o cluster.
Para implantar esses clusters de aceleradores, também recomendamos usar o Cluster Director ou o Cluster Toolkit. Para mais informações, consulte o guia de implantação de cluster respectivo para o tipo de máquina escolhido na tabela a seguir.
| Cargas de trabalho | Recomendações | Guia de implantação de cluster | |
|---|---|---|---|
| Tipo de máquina | Orquestrador | ||
| Pré-treinamento de modelos de fundação |
|
GKE | Criar um cluster do GKE otimizado para IA com configuração padrão |
| Slurm | |||
| Treinamento de modelo grandes | A3 Ultra (NVIDIA H200 141GB) | GKE | Criar um cluster do GKE otimizado para IA com configuração padrão |
| Slurm | |||
| Treinamento de modelo grandes |
|
GKE | Maximizar a largura de banda da rede GPU em clusters do modo Standard |
| Slurm | |||
Opção de consumo recomendada
Para ter um alto nível de garantia na obtenção de grandes clusters de aceleradores, recomendamos usar uma reserva. Especificamente, para minimizar os custos dos recursos reservados, recomendamos que você solicite uma duração de reserva longa o suficiente para receber descontos por uso contínuo. Para mais informações sobre as opções de consumo, consulte Escolher uma opção de consumo.
Recomendações para ajuste fino de modelos
Para ajustar modelos de fundação grandes, clusters menores de aceleradores leem volumes moderados de dados. Esses aceleradores ajustam o modelo para realizar tarefas específicas. Esses jobs de ajuste fino são executados por dias ou até semanas.
As seções a seguir descrevem os aceleradores e a opção de consumo recomendados para usar ao ajustar modelos.
Aceleradores recomendados
Para ajustar modelos no Google Cloud, recomendamos usar tipos de máquina otimizados para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB) e usar um orquestrador para implantar o cluster.
Para implantar esses clusters de aceleradores, também recomendamos usar o Cluster Director ou o Cluster Toolkit. Para mais informações, consulte o guia de implantação de cluster respectivo para o tipo de máquina escolhido na tabela a seguir.
| Cargas de trabalho | Recomendações | Guia de implantação de cluster | |
|---|---|---|---|
| Tipo de máquina | Orquestrador | ||
| Ajuste fino de modelos grandes | A3 Ultra (NVIDIA H200 141GB) | GKE | Criar um cluster do GKE otimizado para IA com configuração padrão |
| Slurm | |||
| Ajuste fino de modelos grandes |
|
GKE | Maximizar a largura de banda da rede GPU em clusters do modo Standard |
| Slurm | |||
Opção de consumo recomendada
Para cargas de trabalho de ajuste refinado, use uma reserva adiantada no modo de calendário para provisionar recursos. Para mais informações sobre as opções de consumo, consulte Escolher uma opção de consumo.
Recomendações para inferência
As seções a seguir descrevem os aceleradores e as opções de consumo recomendados para usar ao realizar a inferência.
Aceleradores recomendados
Os aceleradores recomendados para inferência dependem de você estar realizando inferência de fronteira multi-host ou de modelo grande, ou inferência de fronteira de host único.
Aceleradores recomendados (vários hosts)
Para realizar inferência de modelos grandes ou de fronteira em vários hosts no Google Cloud, use um tipo de máquina otimizado para acelerador A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB) e implante a máquina usando um orquestrador. Para implantar esses clusters de aceleradores, também recomendamos usar o Cluster Director ou o Cluster Toolkit. A tabela fornece links para guias de implantação de cluster para cada tipo de máquina recomendado.
| Cargas de trabalho | Recomendações | Guia de implantação de cluster | |
|---|---|---|---|
| Tipo de máquina | Orquestrador | ||
| Inferência de fronteira de vários hosts |
|
GKE | Criar um cluster do GKE otimizado para IA com configuração padrão |
| Slurm | |||
| Inferência de modelos grandes | A3 Ultra (NVIDIA H200 141GB) | GKE | Criar um cluster do GKE otimizado para IA com configuração padrão |
| Slurm | |||
| Inferência de modelos grandes |
|
GKE | Maximizar a largura de banda da rede GPU em clusters do modo Standard |
| Slurm | |||
Aceleradores recomendados (host único)
A tabela descreve os aceleradores que recomendamos usar para realizar inferência de fronteira de host único. A tabela fornece links para guias de implantação de VM para cada tipo de máquina recomendado.
| Cargas de trabalho | Recomendações | Guia de implantação de VMs | |
|---|---|---|---|
| Tipo de máquina | Orquestrador | ||
| Inferência de fronteira e convencional de host único |
|
N/A | Criar uma instância A4 ou A3 Ultra |
|
Criar uma instância A3 High ou A3 Edge | ||
| G4 (NVIDIA RTX PRO 6000) | Criar uma instância G4 | ||
| A2 (NVIDIA A100) | Criar uma instância A2 | ||
| G2 (NVIDIA L4) | Criar uma instância G2 | ||
| N1 (NVIDIA T4 ou V100) | Criar uma instância N1 | ||
Opção de consumo recomendada
Para inferência, use uma reserva de longa duração ou uma reserva adiantada no modo de calendário. Para mais informações sobre as opções de consumo, consulte Escolher uma opção de consumo.
Recomendações para modelos pequenos ou médios
Para cargas de trabalho de ML que envolvem modelos de pequeno a médio porte, alcançar um equilíbrio ideal entre preço e desempenho é uma consideração principal.
Aceleradores recomendados
A tabela a seguir descreve os aceleradores recomendados para cargas de trabalho de ML de modelos pequenos a médios.
| Cargas de trabalho | Recomendações | Guia de implantação de VMs | |
|---|---|---|---|
| Tipo de máquina | Orquestrador | ||
| ML para modelos pequenos ou médios | G4 (NVIDIA RTX PRO 6000) | N/A | Criar uma instância G4 |
| G2 (NVIDIA L4) | Criar uma instância G2 | ||
| A2 (NVIDIA A100) | Criar uma instância A2 | ||
| A3 Edge (NVIDIA H100 80GB) | Criar uma instância do A3 Edge | ||
| N1 (NVIDIA T4 ou V100) | Criar uma instância N1 | ||
Recomendações para HPC
Para cargas de trabalho de HPC, qualquer série de máquinas otimizada para aceleradores ou série de máquinas otimizada para computação funciona bem. Se você estiver usando uma série de máquinas otimizadas para aceleradores, a melhor opção vai depender da quantidade de computação que precisa ser transferida para a GPU. Para uma lista detalhada de recomendações para cargas de trabalho de HPC, consulte Práticas recomendadas para executar cargas de trabalho de HPC.
Resumo das recomendações
A tabela a seguir resume os aceleradores e as opções de consumo recomendados para cada carga de trabalho.
| Recurso | Recomendação |
|---|---|
| Pré-treinamento de modelos | |
| Família de máquinas | Use um dos seguintes tipos de máquina otimizados para aceleradores: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB). |
| Opção de consumo | 'Usar reservas adiantadas padrão |
| Ajuste fino de modelos | |
| Família de máquinas | Use os tipos de máquina otimizados para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) ou A3 High (NVIDIA H100 de 80 GB). |
| Opção de consumo | 'Usar reservas adiantadas padrão |
| Inferência | |
| Família de máquinas | Use um dos seguintes tipos de máquina: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), A3 High (NVIDIA H100 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) ou N1 (NVIDIA T4 ou V100). |
| Opção de consumo | Usar reservas, sob demanda ou spot |
| ML para modelos pequenos ou médios | |
| Família de máquinas | Use um dos seguintes tipos de máquina: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) ou N1 (NVIDIA T4 ou V100). |
| Opção de consumo | Usar reservas sob demanda, spot ou padrão |
| Armazenamento | Usar o Cloud Storage FUSE |
| HPC | |
| Consulte a seção de resumo das práticas recomendadas para executar cargas de trabalho de HPC. | |
A seguir
- Saiba como criar um cluster do GKE otimizado para IA.
- Saiba como criar um cluster do Slurm totalmente gerenciado.
- Saiba como criar uma instância otimizada para IA.