As cargas de trabalho de inteligência artificial (IA), machine learning (ML) e computação de alto desempenho (HPC) geralmente exigem a criação de uma imagem personalizada que inclua pacotes de software adicionais e seja ajustada para um desempenho ideal. Agora é possível usar as Imagens de computação avançada para configurar um ambiente otimizado para suas cargas de trabalho de IA/ML ou HPC.
As imagens de computação avançada fornecem uma pilha de imagens padronizada para infraestrutura de IA/ML e HPC. Essas imagens eliminam a necessidade de criar manualmente suas próprias imagens personalizadas para cargas de trabalho de IA/ML e HPC.
Vantagens
As Advanced Compute Images oferecem os seguintes benefícios:
- Instâncias de computação prontas para cargas de trabalho de IA/ML ou HPC por padrão. Não é necessário ajustar manualmente o desempenho, gerenciar reinicializações de instâncias, instalar agentes do Slurm ou acompanhar as atualizações mais recentes do Google Cloud para cargas de trabalho de IA/ML ou HPC com acoplamento rígido.
- Desempenho consistente e reproduzível. A padronização de imagens oferece desempenho consistente e reproduzível no nível do aplicativo.
Recursos do Advanced Compute Images
As imagens de computação avançada contêm várias camadas de configurações para oferecer suporte à execução de cargas de trabalho de IA/ML e HPC.
- Configurações do sistema operacional: inclui desativar atualizações automáticas, definir ulimits otimizados para HPC, ajustar parâmetros sysctl do kernel e configurar configurações de segurança, como SELinux.
- Ajuste de rede: contém os scripts necessários para o ajuste de rede, como a ativação do serviço de várias filas.
- Google Cloud integration: instala e configura a Google Cloud CLI e o Agente de operações.
- Ferramentas de contêiner: instala e configura todos os softwares relacionados a contêineres, incluindo:
- Docker
- NVIDIA Container Toolkit (versão 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis (em inglês)
- NVIDIA: instala as seguintes ferramentas:
- Versão 13.0 do NVIDIA CUDA Toolkit,
- NVIDIA Data Center GPU Manager (DCGM) versão 4
- NVIDIA Fabric Manager
- Plug-in NCCL/gIB
MPI: instala as bibliotecas da interface de transmissão de mensagens (MPI). Instala o Open MPI em imagens baseadas no Ubuntu e no Rocky Linux. Para imagens baseadas no Rocky Linux, também é possível instalar e configurar a biblioteca Intel MPI usando um script pré-instalado:
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm: instala os componentes principais necessários para criar um nó de cluster do Slurm, incluindo:
- Binários do Slurm (versão 25.11)
- Munge para autenticação
- PMIx para gerenciamento de processos
- Biblioteca JSON Web Token (JWT) (
libjwt)
Clientes do sistema de arquivos: instala ferramentas do lado do cliente para acessar vários sistemas de arquivos, como o Cloud Storage FUSE, utilitários NFS (
nfs-utils) e o cliente Lustre.Ferramentas para desenvolvedores: instala cadeias de ferramentas e utilitários comuns de desenvolvimento e depuração, como:
Gerenciamento de ambiente: instala e configura ferramentas de gerenciamento de ambiente, principalmente o Lmod, e configura os scripts de perfil necessários para disponibilizar o comando do módulo aos usuários.
RDMA: instala drivers e pacotes de acesso direto à memória remota (RDMA) em imagens de CPU (baseadas no Rocky Linux), incluindo:
rdma-coree bibliotecas de desenvolvimentolibfabricperftestkmod-idpf-irdma: driver Intel Ethernet RDMA para tipos de máquinas otimizados para computação compatíveis- Utilitários
infiniband-diags,libibverbselibrdmacm
Hardware e famílias de imagens compatíveis
O ACI oferece suporte a duas plataformas de hardware principais:
CPU (HPC): oferece suporte a cargas de trabalho de CPU e tem as seguintes características:
- São otimizados para cargas de trabalho com uso intensivo de computação
- Suporte ao Rocky Linux 9
- Vêm com drivers e utilitários RDMA para oferecer suporte ao Cloud RDMA
- Vêm com bibliotecas MPI pré-integradas, incluindo Open MPI e Intel MPI configurável
GPU (IA/ML/HPC): compatível com cargas de trabalho de GPU e com as seguintes características:
- São otimizados para aceleradores NVIDIA
- Suporte ao Ubuntu LTS 22.04 e ao Ubuntu LTS 24.04
- Vêm com drivers CUDA e NVIDIA pré-integrados
- Inclui drivers e utilitários RDMA para oferecer suporte a MRDMA para comunicação de GPU para GPU.
- São adequados para cargas de trabalho de IA, ML ou HPC
- As imagens padrão são instaladas quando você implanta blueprints de cluster Slurm para tipos de máquina A4X, A4 e A3 Ultra no Cluster Toolkit?
| Hardware | SO | Orquestrador | Recursos | Arquitetura | Série de máquinas compatível | Família de imagens |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | nenhum |
|
AMD x86_64 | C2D, H3 e H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 8 | nenhum |
|
AMD x86_64 | C2D, H3 e H4D | aci-cpu-rocky-linux-8-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D, H3 e H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64 |
| GPU | Ubuntu LTS 24.04 | nenhum |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | nenhum |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
Pacotes pré-instalados (ou RPMs)
As imagens de computação avançada vêm com várias ferramentas, bibliotecas, drivers e pacotes pré-instalados. Para conferir uma lista do que está instalado em qualquer imagem, consulte o arquivo de manifesto dela.
O arquivo de manifesto pode ser encontrado em /usr/share/google/manifest.txt.
Fases do ciclo de vida e suporte da família de imagens
Todas as famílias de imagens de computação avançada seguem um ciclo de vida padronizado para garantir segurança, estabilidade e cronogramas de manutenção previsíveis. Durante cada fase do ciclo de vida, uma família de imagens tem um dos seguintes status de suporte:
- Compatível:
- Recebe atualizações críticas de segurança e correções de bugs
- Suporte do Cloud Customer Care.
- Pode ser usado para criar instâncias de computação.
- Não compatível:
- Não recebe mais atualizações críticas de segurança ou correções de bugs.
- Nenhum recurso novo.
- Indisponível pelo Cloud Customer Care.
- Não pode ser usado para criar instâncias de computação.
O ciclo de vida de uma família de imagens avançadas de computação consiste em quatro fases:
| Fase do ciclo de vida | Status de compatibilidade | Descrição e impacto |
|---|---|---|
| Ativo | Com suporte | Recomendado para novas implantações. Por 12 meses após a data de lançamento, a família de imagens tem suporte total. Recebe atualizações críticas de segurança e correções de bugs. |
| Descontinuado (data de fim da vida útil) | Sem suporte | Recomendamos que você migre para uma família de imagens compatível. Por aproximadamente seis meses após o fim da fase ativa, a família de imagens é descontinuada. Nenhum novo recurso ou patch é lançado. Google Cloud avisos do console e da Google Cloud CLI aparecem quando você cria instâncias que usam essa família de imagens. |
| Obsoleto | Sem suporte | Depois que a fase de descontinuação terminar, a família de imagens vai ficar obsoleta. Não é mais possível criar instâncias de computação usando essa família de imagens. As instâncias de computação atuais continuam sendo executadas, mas correm o risco de incompatibilidade com o controlador do Slurm. |
| Exclusão | Sem suporte | Três meses depois que uma família de imagens fica obsoleta, o recurso de imagem do Advanced Compute Images é excluído permanentemente. As instâncias de computação atuais continuam sendo executadas, mas correm o risco de incompatibilidade com o controlador do Slurm e vulnerabilidades. |
Para informações sobre as datas exatas de fim do suporte de uma família de imagens, consulte Hardware e famílias de imagens compatíveis.
Preços
As imagens de computação avançada estão disponíveis sem custo adicional. Como as imagens avançadas de computação são executadas no Compute Engine, você pode receber cobranças pelos recursos do Compute Engine, como vCPUs, GPUs, TPUs, discos e memória. Para saber mais, consulte Preços do Compute Engine.
A seguir
- Criar uma instância com Advanced Compute Images
Saiba como implantar blueprints de cluster do Slurm prontos para uso com imagens de computação avançada: