Visão geral das opções de implantação

Para executar cargas de trabalho de inteligência artificial (IA), machine learning (ML) ou computação de alto desempenho (HPC), implante instâncias e clusters do Compute Engine otimizados para IA que usam máquinas A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs). Para mais informações sobre os recursos dessas máquinas que permitem executar clusters de IA e ML em grande escala, consulte Visão geral do gerenciamento de clusters.

É possível criar instâncias A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs) diretamente do Compute Engine, usando serviços gerenciados como o Google Kubernetes Engine (GKE) ou ferramentas de implantação como o Cluster Toolkit.

Para a opção mais adequada de criar instâncias ou clusters de computação para seu caso de uso, escolha uma das seguintes opções:

Opção Caso de uso
Cluster Director Você quer um serviço totalmente gerenciado que automatize a configuração e configuração dos seus clusters do Slurm. O Cluster Director ajuda você a configurar recursos de computação, rede e armazenamento para seus clusters, de modo a maximizar o desempenho e minimizar os tempos de inatividade. Para saber mais, consulte Criar um cluster do Slurm totalmente gerenciado para cargas de trabalho de IA.
Cluster Toolkit

Você quer usar um software de código aberto que simplifique o processo de implantação de clusters do Slurm e do GKE. O Cluster Toolkit foi projetado para ser altamente personalizável e extensível. É possível usar blueprints para provisionar recursos de rede e armazenamento. Para saber mais, consulte:

GKE

Você quer flexibilidade máxima na configuração do cluster do GKE com base nas necessidades da sua carga de trabalho. Para saber mais, consulte:

Usar o Compute Engine

Você quer ter controle total da camada de infraestrutura para configurar seu próprio orquestrador. Para saber mais, consulte:

A seguir