Planifier et créer votre infrastructure d'IA

Ce document explique comment créer un cluster pour vos charges de travail d'IA sur AI Hypercomputer. Plus précisément, ce document vous guide tout au long du processus et des choix à faire lorsque vous démarrez un cluster. Au lieu d'effectuer une évaluation manuelle, vous pouvez demander à Gemini dans la console Google Cloud de comparer les options de consommation pour votre charge de travail et votre budget. Pour en savoir plus, consultez Concevoir une infrastructure d'IA avec Compute Advisor.

Dans ce document, nous partons du principe que vous connaissez la terminologie couramment utilisée pour les charges de travail d'IA et de ML, comme l'entraînement et l'inférence de modèles. Il suppose également que vous avez identifié la charge de travail d'IA spécifique pour laquelle vous devez déterminer le type de machine et les besoins en capacité optimaux pour votre déploiement (par exemple, le pré-entraînement, l'affinage ou l'inférence du modèle de fondation).

Démarrer un cluster

Pour démarrer un cluster, procédez comme suit :

  1. Déterminer votre charge de travail et choisir un type de machine
  2. Choisir une option de consommation et obtenir de la capacité
  3. Choisir une option de déploiement
  4. Choisir un orchestrateur
  5. Choisir le système d'exploitation et l'image du cluster
  6. Créer votre cluster
  7. Provisionner du stockage pour votre charge de travail

Déterminer votre charge de travail et choisir un type de machine

Sélectionnez un type de machine pour votre charge de travail d'IA. AI Hypercomputer permet de créer des clusters pour les GPU en cluster et les GPU généraux.

Pour vous aider à faire votre choix, déterminez les exigences de votre charge de travail et faites-les correspondre au type de machine et de GPU recommandés :

  • GPU en cluster : idéal pour les charges de travail à grande échelle et hautes performances, comme le pré-entraînement de modèles de fondation, l'affinage de grands modèles et l'inférence sur plusieurs hôtes.
  • GPU à usage général : ils sont idéaux pour l'inférence et la mise en service classiques, la génération augmentée par récupération (RAG), ainsi que l'entraînement et l'affinage de modèles de petite et moyenne taille à moindre coût.

Pour faire correspondre votre charge de travail au type de machine recommandé, utilisez ce tableau :

GPU type Charge de travail ou cas d'utilisation Types de machines recommandés
GPU en cluster Pré-entraînement des modèles de fondation et inférence sur plusieurs hôtes A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)*
Entraînement, affinage et inférence de grands modèles A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go)
Inférence et affinage de modèles traditionnels A3 Mega (NVIDIA H100 80 Go), A3 High (NVIDIA H100 80 Go)
GPU général Inférence et diffusion en périphérie à haut débit A3 Edge (NVIDIA H100 80 Go)
Diffusion hautes performances sur un seul nœud et affinage à petite échelle A2 (NVIDIA A100)
Inférence d'entrée de gamme optimisée pour les coûts G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 ou V100)
Inférence courante, RAG et entraînement de modèles de petite à moyenne taille G2 (NVIDIA L4)

Pour en savoir plus sur chaque série de machines, consultez À propos des accélérateurs GPU.

Choisir une option de consommation et obtenir de la capacité

Sélectionnez une option de consommation pour vos ressources GPU en fonction du type de machine choisi et de l'utilisation de GPU généraux ou de GPU en cluster.

Options de consommation pour les GPU à usage général

Option d'utilisation Disponible pour Application idéale Comment faire une demande
À la demande Tous les GPU généraux. Charges de travail ne nécessitant pas de capacité assurée. Créez une instance ou un cluster de calcul, puis spécifiez le modèle de provisionnement standard. Pour obtenir des instructions, consultez Créer des instances de VM.

Conseil : Pour augmenter vos chances d'obtenir une capacité GPU générale, utilisez des VM à démarrage flexible ou Spot.
Réservations standards et réservations futures standards Tous les GPU généraux. Charges de travail qui nécessitent une capacité assurée immédiatement (réservations standards) ou pour une date future spécifique (réservations futures standards). Créez une réservation à la demande ou une demande de réservation future. Pour obtenir des instructions, consultez Réserver de la capacité.
Démarrage flexible Tous les types de machines GPU, à l'exception d'A4X Max et A4X. Charges de travail nécessitant des clusters denses à courte durée de vie (jusqu'à sept jours). Offre une allocation de ressources dense et une remise allant jusqu'à 53% sur les types de machines compatibles. Dans le cas contraire, les tarifs à la demande standards s'appliquent. Créez une requête à l'aide de Compute Engine, Cluster Director, Cluster Toolkit ou GKE. Les ressources sont provisionnées dès qu'elles sont disponibles (le délai de démarrage n'est pas immédiat). Pour obtenir des instructions, consultez Obtenir la capacité.
Spot Tous les types de machines GPU, à l'exception d'A4X Max et A4X. Charges de travail tolérantes aux pannes, par lot ou à courte durée de vie. Elles offrent la remise la plus importante (entre 61% et 90%), mais les ressources de calcul peuvent être préemptées à tout moment. Créez des instances ou des pools de nœuds immédiatement à l'aide du modèle de provisionnement Spot. Pour obtenir des instructions, consultez Obtenir la capacité.

Options de consommation pour les GPU en cluster

Option d'utilisation Disponible pour Application idéale Comment faire une demande
Réservations futures pour les blocs de capacité Tous les GPU en cluster et les types de machines A3 Edge. Charges de travail qui nécessitent de la stabilité pendant une période prolongée, comme le pré-entraînement de modèles de fondation ou l'inférence de modèles de fondation sur plusieurs hôtes. Cette méthode de réservation offre une allocation dense des ressources et un pool Hyperdisk facultatif, ainsi que des remises sur les processeurs virtuels, la mémoire, les GPU, les disques SSD locaux et les pools Hyperdisk si vous réservez des ressources pendant 365 jours ou plus. Demandez des ressources via l'équipe chargée de votre compte Google pour une date et une heure ultérieures, et pour une durée de 90 jours ou plus.
Réservations futures en mode Agenda Tous les GPU en cluster, sauf A4X Max et A4X. Charges de travail qui s'exécutent pendant 90 jours maximum et qui nécessitent de la stabilité, comme le pré-entraînement ou l'affinage de modèles. Offre une allocation de ressources dense et une remise pouvant atteindre 53 %. Créez une demande de réservation en libre-service pour une date et une heure ultérieures. Google Cloud doit approuver la demande. Pour obtenir des instructions, consultez Réserver de la capacité.
Démarrage flexible Tous les types de machines GPU, sauf A4X Max et A4X. Charges de travail nécessitant des clusters denses à courte durée de vie (jusqu'à sept jours). Offre une allocation de ressources dense et une remise allant jusqu'à 53% sur les types de machines compatibles. Dans le cas contraire, les tarifs à la demande standards s'appliquent. Créez une requête à l'aide de Compute Engine, Cluster Director, Cluster Toolkit ou GKE. Les ressources sont provisionnées dès qu'elles sont disponibles (le délai de démarrage n'est pas immédiat). Pour obtenir des instructions, consultez Obtenir la capacité.
Spot Tous les types de machines GPU, sauf A4X Max et A4X. Charges de travail tolérantes aux pannes, par lot ou à courte durée de vie. Elles offrent la remise la plus importante (entre 61% et 90%), mais les ressources de calcul peuvent être préemptées à tout moment. Créez des instances ou des pools de nœuds immédiatement à l'aide du modèle de provisionnement Spot. Pour obtenir des instructions, consultez Obtenir la capacité.

Choisir une option de déploiement

En fonction du niveau de contrôle dont vous avez besoin sur le déploiement de votre cluster, choisissez l'une des options suivantes :

Hautement géré

Les options de déploiement hautement gérées automatisent la configuration et l'orchestration de vos ressources de calcul, de réseau et de stockage, ce qui réduit la charge opérationnelle de la gestion des clusters. Pour déployer et configurer votre infrastructure, utilisez Cluster Director, Cluster Toolkit ou GKE.

  • Cluster Director : un produitGoogle Cloud qui automatise la configuration complexe des clusters. Cette solution vous aide à configurer les ressources de calcul, de réseau et de stockage de vos clusters pour maximiser les performances et réduire les temps d'arrêt. Cluster Director est conçu pour les administrateurs informatiques et les chercheurs en IA qui souhaitent éviter la surcharge liée à la gestion d'un cluster et se concentrer plutôt sur l'exécution de leurs charges de travail.

  • Cluster Toolkit : outil Open Source proposé par Google qui simplifie la configuration et le déploiement de clusters pour GKE ou Compute Engine. Vous utilisez des plans prédéfinis pour déployer des configurations courantes, telles que des types de machines A4 avec Slurm. Vous pouvez modifier les plans pour personnaliser les déploiements et votre pile logicielle.

  • GKE : service Kubernetes géré et plate-forme d'orchestration de conteneurs Open Source. GKE propose des fonctionnalités telles que l'autoscaling et la haute disponibilité. Il est également capable d'orchestrer des applications conteneurisées, de prendre en charge du matériel spécialisé et d'être compatible avec l'écosystème Google Cloud, ce qui le rend idéal pour déployer et gérer des charges de travail d'IA ou de ML. Vous pouvez déployer des clusters GKE directement ou à l'aide de Cluster Toolkit.

Moins de gestion, plus de contrôle

Pour un contrôle plus précis de vos clusters et des logiciels qui y sont installés, créez un cluster Compute Engine à l'aide de groupes d'instances gérés (MIG) Compute Engine ou en créant des instances de manière groupée. Ensuite, installez manuellement les logiciels clés dont vous avez besoin sur les instances.

Choisir un orchestrateur

Un orchestrateur automatise la gestion de vos clusters. Avec un orchestrateur, vous n'avez pas à gérer chaque instance de calcul du cluster. Un orchestrateur, tel que Slurm ou GKE, gère des tâches telles que la mise en file d'attente des jobs, l'allocation des ressources, l'autoscaling (dans le cas de GKE) et d'autres tâches de gestion quotidienne des clusters.

  • Slurm : Slurm est un orchestrateur Open Source couramment utilisé pour les charges de travail HPC, d'IA ou de ML. Pour une expérience Slurm gérée, vous pouvez utiliser Cluster Director. Pour utiliser Slurm de manière native, vous pouvez utiliser Cluster Toolkit (qui propose des plans de cluster qui installent automatiquement Slurm sur vos clusters) ou installer manuellement Slurm sur un cluster Compute Engine.

  • GKE : GKE est un service géré basé sur Kubernetes, une plate-forme d'orchestration de conteneurs Open Source. GKE est idéal pour déployer et gérer des charges de travail d'IA ou de ML, en raison de sa capacité à orchestrer des applications conteneurisées, de sa prise en charge de matériel spécialisé et de sa place dans l'écosystème Google Cloud. Vous pouvez déployer des clusters GKE directement ou à l'aide de Cluster Toolkit.

  • Utilisation de votre propre outil d'orchestration : pour utiliser d'autres outils d'orchestration, utilisez des clusters Compute Engine. La création d'un cluster Compute Engine est l'option la moins gérée proposée sur Google Cloud. Cela signifie que vous êtes responsable de la configuration, de la maintenance et de la mise à jour de vos instances.

Choisir l'image système

L'image à utiliser dépend de l'infrastructure GPU que vous utilisez (GPU en cluster ou GPU généraux) et de la façon dont vous prévoyez de déployer vos clusters (GKE, Slurm ou Compute Engine). Pour les clusters GKE, utilisez Container-Optimized OS. Pour les clusters Compute Engine et Slurm, sélectionnez une image système optimisée pour les accélérateurs, tels que les GPU. Vous pouvez également sélectionner une image de conteneur de couche logicielle de deep learning (DLSL) pour votre charge de travail.

Pour en savoir plus, consultez Images AI Hypercomputer.

Images pour les clusters GKE

Pour créer des clusters GKE, utilisez les images d'OS de conteneur par défaut pour les modes Standard et Autopilot. Toutefois, en mode Standard, vous pouvez également choisir d'utiliser d'autres images disponibles, comme Ubuntu.

Si vous utilisez Cluster Toolkit pour déployer votre cluster, vous ne pouvez utiliser que des images d'OS de conteneur, car ce sont les images intégrées aux plans de cluster. Pour en savoir plus sur chaque image de nœud, consultez Images de nœuds dans la documentation GKE.

GKE propose également des images de conteneurs DLSL (Deep Learning Software Layer) qui installent des packages tels que NVIDIA CUDA et NCCL, ainsi que des frameworks de ML tels que PyTorch, fournissant un environnement prêt à l'emploi pour les charges de travail de deep learning. Ces images de conteneur DLSL prédéfinies sont testées et vérifiées pour fonctionner de manière fluide sur les clusters GKE.

Images d'OS pour les clusters Compute Engine

AI Hypercomputer propose des images optimisées pour exécuter des charges de travail d'IA et de ML à l'aide de Compute Engine. Choisissez l'OS que vous connaissez le mieux :

  • Accélérateur Rocky Linux 9
  • Accélérateur Rocky Linux 8
  • Accélérateur Ubuntu 24.04 LTS
  • Accélérateur Ubuntu 22.04 LTS

Si vous utilisez Cluster Toolkit, ces images d'accélérateur sont déjà incluses dans les plans Cluster Toolkit, car Cluster Toolkit crée des images personnalisées qui étendent les images d'OS d'accélérateur Ubuntu LTS.

Pour en savoir plus sur chaque image d'OS, consultez Détails des systèmes d'exploitation dans la documentation Compute Engine.

Créer votre cluster

Après avoir examiné le processus de création de cluster et pris des décisions préliminaires pour votre charge de travail, créez votre cluster à l'aide de l'une des options suivantes :

Provisionner du stockage pour votre charge de travail

Choisissez un service de stockage à provisionner en fonction des exigences en termes de performances, de coûts et d'architecture de stockage.