Les charges de travail d'intelligence artificielle (IA), de machine learning (ML) et de calcul hautes performances (HPC) vous obligent souvent à créer une image personnalisée qui inclut des packages logiciels supplémentaires et qui est optimisée pour des performances optimales. Vous pouvez désormais utiliser les images de calcul avancé pour configurer un environnement optimisé pour vos charges de travail d'IA/ML ou de HPC.
Les images de calcul avancé fournissent une pile d'images standardisée pour l'infrastructure d'IA/de ML et de HPC. Ces images peuvent vous éviter d'avoir à créer manuellement vos propres images personnalisées pour les charges de travail d'IA/de ML et HPC.
Avantages
Les images de calcul avancées offrent les avantages suivants :
- Instances de calcul prêtes pour les charges de travail d'IA/de ML ou de HPC par défaut. Il n'est pas nécessaire d'ajuster manuellement les performances, de gérer les redémarrages d'instances, d'installer des agents Slurm ni de se tenir informé des dernières mises à jour Google Cloud pour les charges de travail d'IA/de ML ou de HPC étroitement couplées.
- Des performances cohérentes et reproductibles. La standardisation des images vous permet d'obtenir des performances cohérentes et reproductibles au niveau de l'application.
Fonctionnalités des images Advanced Compute Images
Les images de calcul avancé contiennent plusieurs couches de configurations pour prendre en charge l'exécution des charges de travail d'IA/de ML et HPC.
- Configurations du système d'exploitation : incluent la désactivation des mises à jour automatiques, la définition de limites ulimit optimisées pour le HPC, le réglage des paramètres sysctl du noyau et la configuration des paramètres de sécurité tels que SELinux.
- Optimisation du réseau : contient les scripts nécessaires à l'optimisation du réseau, comme l'activation du service multiqueue.
- Google Cloud integration : installe et configure Google Cloud CLI et l'agent Ops.
- Outils de conteneur : installe et configure tous les logiciels liés aux conteneurs, y compris :
- Docker
- NVIDIA Container Toolkit (version 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA : installe les outils suivants :
- Version 13.0 de NVIDIA CUDA Toolkit,
- Gestionnaire de GPU du centre de données NVIDIA (DCGM) version 4
- NVIDIA Fabric Manager
- Plug-in NCCL/gIB
MPI : installe les bibliothèques MPI (Message Passing Interface). Installe Open MPI sur les images basées sur Ubuntu et Rocky Linux. Pour les images basées sur Rocky Linux, vous pouvez également installer et configurer la bibliothèque Intel MPI à l'aide d'un script préinstallé :
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm : installe les composants de base requis pour créer un nœud de cluster Slurm, y compris :
- Binaires Slurm (version 25.11)
- Munge pour l'authentification
- PMIx pour la gestion des processus
- Bibliothèque JSON Web Token (JWT) (
libjwt)
Clients de système de fichiers : installe des outils côté client pour accéder à différents systèmes de fichiers, tels que Cloud Storage FUSE, les utilitaires NFS (
nfs-utils) et le client Lustre.Outils pour les développeurs : installe les chaînes d'outils et les utilitaires de développement et de débogage courants, tels que :
Gestion de l'environnement : installe et configure les outils de gestion de l'environnement, principalement Lmod, et configure les scripts de profil nécessaires pour rendre la commande de module disponible pour les utilisateurs.
RDMA : installe les pilotes et les packages RDMA (Remote Direct Memory Access) sur les images de processeur (basées sur Rocky Linux), y compris :
rdma-coreet des bibliothèques de développementlibfabricperftestkmod-idpf-irdma: pilote Intel Ethernet RDMA pour les types de machines optimisés pour le calcul compatibles- Utilitaires
infiniband-diags,libibverbsetlibrdmacm
Matériel et familles d'images compatibles
ACI est compatible avec deux plates-formes matérielles principales :
CPU (HPC) : compatible avec les charges de travail de processeur et présentant les caractéristiques suivantes :
- sont optimisées pour les charges de travail exigeantes en calcul ;
- Prise en charge de Rocky Linux 9
- Fournies avec des pilotes et des utilitaires RDMA pour prendre en charge Cloud RDMA
- Ils sont fournis avec des bibliothèques MPI pré-intégrées, y compris Open MPI et Intel MPI configurable.
GPU (IA/ML/HPC) : compatibles avec les charges de travail GPU et présentant les caractéristiques suivantes :
- sont optimisés pour les accélérateurs NVIDIA ;
- Compatibilité avec Ubuntu LTS 22.04 et Ubuntu LTS 24.04
- Intégration de CUDA et des pilotes NVIDIA
- Inclut les pilotes et utilitaires RDMA pour prendre en charge MRDMA pour la communication GPU à GPU
- Conviennent aux charges de travail d'IA, de ML ou de HPC
- Les images par défaut sont-elles installées lorsque vous déployez des blueprints de cluster Slurm pour les types de machines A4X, A4 et A3 Ultra dans Cluster Toolkit ?
| Matériel | OS | Outil d'orchestration | Fonctionnalités | Architecture | Séries de machines compatibles | Famille d'images |
|---|---|---|---|---|---|---|
| Processeur | Rocky Linux 9 | aucun |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-amd64 |
| Processeur | Rocky Linux 8 | aucun |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-8-amd64 |
| Processeur | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64 |
| GPU | Ubuntu LTS 24.04 | aucun |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | aucun |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
Packages préinstallés (ou RPM)
Les images de calcul avancé sont fournies avec divers outils, bibliothèques, pilotes et packages préinstallés. Pour afficher la liste des éléments installés pour une image, consultez le fichier manifeste correspondant.
Vous trouverez le fichier manifeste à l'adresse /usr/share/google/manifest.txt.
Phases du cycle de vie et assistance pour les familles d'images
Toutes les familles d'images de calcul avancées suivent un cycle de vie standardisé pour garantir la sécurité, la stabilité et des plannings de maintenance prévisibles. À chaque phase du cycle de vie, une famille d'images présente l'un des états de compatibilité suivants :
- Pris en charge :
- Reçoit les mises à jour de sécurité critiques et les corrections de bugs
- Assistance fournie par Cloud Customer Care.
- Peut être utilisé pour créer des instances de calcul.
- Non pris en charge :
- ne reçoit plus de mises à jour de sécurité critiques ni de corrections de bugs.
- Aucune nouvelle fonctionnalité.
- Non compatible avec Cloud Customer Care.
- Ne peut pas être utilisé pour créer des instances de calcul.
Le cycle de vie d'une famille d'images de calcul avancé se compose de quatre phases :
| Phase du cycle de vie | Compatibilité | Description et impact |
|---|---|---|
| Actif | Compatible | Recommandé pour les nouveaux déploiements. La famille d'images est entièrement prise en charge pendant 12 mois après la date de disponibilité. Reçoit les mises à jour de sécurité critiques et les corrections de bugs. |
| Obsolète (date de fin de vie) | Non compatible | Nous vous recommandons de migrer vers une famille d'images compatible. Environ six mois après la fin de la phase active, la famille d'images est obsolète. Aucune nouvelle fonctionnalité ni aucun correctif ne sont publiés. Des avertissements de la console Google Cloud et de Google Cloud CLI s'affichent lorsque vous créez des instances qui utilisent cette famille d'images. |
| Obsolète | Non compatible | Une fois la phase d'abandon terminée, la famille d'images devient obsolète. Vous ne pouvez plus créer d'instances de calcul à l'aide de cette famille d'images. Les instances de calcul existantes continuent de s'exécuter, mais risquent d'être incompatibles avec le contrôleur Slurm. |
| Suppression | Non compatible | Trois mois après qu'une famille d'images est devenue obsolète, la ressource d'image Advanced Compute Images sous-jacente est définitivement supprimée. Les instances de calcul existantes continuent de s'exécuter, mais risquent d'être incompatibles avec le contrôleur Slurm et de présenter des failles de sécurité. |
Pour connaître les dates exactes de fin de la compatibilité pour une famille d'images, consultez Matériel et familles d'images compatibles.
Tarifs
Les images de calcul avancées sont disponibles sans frais supplémentaires. Étant donné que les images de calcul avancées s'exécutent sur Compute Engine, vous pouvez être facturé pour les ressources Compute Engine telles que les processeurs virtuels, les GPU, les TPU, les disques et la mémoire. Pour en savoir plus, consultez la page Tarifs de Compute Engine.
Étapes suivantes
- Créer une instance avec Advanced Compute Images
Découvrez comment déployer des plans de cluster Slurm clés en main avec les images de calcul avancé :