Choisir votre infrastructure d'accélérateur

Ce document vous permet d'identifier l'infrastructure d'accélérateur optimale pour vos charges de travail d'intelligence artificielle (IA) et de machine learning (ML) en fonction de votre étape du cycle de vie, comme le prototypage à petite échelle, l'inférence en temps réel et l'entraînement distribué massif. AI Hypercomputer organise les offres d'accélérateurs en deux catégories : les GPU généraux et les GPU en cluster.

Infrastructure GPU

AI Hypercomputer propose deux catégories distinctes de GPU. Chaque catégorie dispose d'un modèle de gestion distinct qui détermine comment le système gère les événements du cycle de vie, la maintenance et l'optimisation de la mise en réseau pour votre charge de travail :

Modèle de gestion des GPU généraux

Le modèle de gestion des GPU généraux est conçu pour les charges de travail qui privilégient l'indépendance des ressources et la haute disponibilité. Ce modèle utilise le plan de gestion standard Google Cloud , offrant une expérience familière aux équipes qui utilisent déjà Compute Engine ou GKE.

  • Maintenance : asynchrone. Les instances individuelles sont mises à jour indépendamment. Dans un parc de diffusion multinœud, un événement de maintenance sur un nœud n'a pas d'incidence sur la disponibilité des autres, ce qui permet de rediriger le trafic vers des nœuds sains sans interrompre l'ensemble du job.

  • Cas d'utilisation principaux : recommandé pour les tâches courantes telles que l'inférence en temps réel, la mise en service du modèle, le prototypage à petite échelle et les environnements de développement où l'échelle du supercalcul n'est pas requise.

Séries de machines avec GPU généraux

Les séries de machines suivantes sont des GPU généraux :

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • A3 High (1, 2 ou 4 GPU)

Pour obtenir des informations techniques sur chacune des machines avec GPU généraux, consultez la section Types de machines avec GPU.

Modèle de gestion des GPU en cluster

Le modèle de gestion des GPU en cluster est un environnement de classe supercalcul conçu pour l'entraînement distribué à grande échelle. Les ressources sont gérées en tant que système unique et étroitement couplé à l'aide d'une pile de GPU en cluster.

  • Maintenance : coordonnée. Ce modèle coordonne les événements de maintenance pour prendre en charge les charges de travail étroitement couplées. Pour l'entraînement distribué, vous pouvez utiliser la maintenance synchronisée, où les mises à jour sont appliquées simultanément sur tous les nœuds. Cette approche empêche les redémarrages de nœuds d'interrompre les jobs et maximise le débit utile. Ce modèle propose également des notifications de maintenance de 90 jours.

  • Cas d'utilisation principaux : conçu pour l'entraînement de modèles de base à l'échelle exa avec des milliers de milliards de paramètres ou l'exécution de simulations complexes de calcul hautes performances (HPC), telles que la découverte de médicaments et le repliement des protéines.

Séries de machines avec GPU en cluster

Les séries de machines suivantes sont des GPU en cluster :

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High (8 GPU)

Pour obtenir des informations techniques sur chacune des machines avec GPU en cluster, consultez la section Types de machines avec GPU.

Matrice des fonctionnalités

Comparez les caractéristiques techniques et opérationnelles des modèles de gestion des GPU généraux et des GPU en cluster :

Caractéristique Modèle de gestion des GPU généraux Modèle de gestion des GPU en cluster
Cas d'utilisation principaux Inférence, mise en service du modèle, prototypage et développement Entraînement distribué à grande échelle et HPC
Maintenance Asynchrone : les mises à jour indépendantes des nœuds permettent de rediriger le trafic sans interrompre les jobs Coordonnée : prend en charge les mises à jour coordonnées (synchronisées) à l'échelle du cluster pour synchroniser les nœuds et maximiser le débit utile
Matériel cible G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge, et A3 High (1, 2 ou 4 GPU) A4X, A4 (Blackwell), A3 Ultra, A3 Mega et A3 High (8 GPU)
Mise en réseau Mise en réseau VPC standard via des interfaces gVNIC (à l'exception d'A3 Edge, qui utilise GPUDirect-TCPX sur plusieurs VPC) Tissus spécialisés à faible latence (RDMA, RoCE, TCPX ou NVIDIA NVLink)
Pile de gestion Plan standard Google Cloud (Compute Engine ou GKE) Pile de gestion spécialisée (par exemple, Cluster Director)
Fiabilité Réparation automatique standard des nœuds et disponibilité au niveau des pods Suite spécialisée de ressources et de récupération

Matrice de décision

Utilisez cette matrice pour identifier les familles de matériel qui correspondent à l'objectif de votre charge de travail spécifique :

Si votre charge de travail implique... Infrastructure GPU recommandée Série de machines recommandée
Prototypage et développement GPU généraux G2, G4, A2, N1+T4, A3 Edge
Inférence en temps réel (moins de 100 milliards de paramètres) GPU généraux G2, G4, A2, N1+T4, A3 Edge
Inférence sur plusieurs GPU GPU en cluster A3, A4
Entraînement et inférence à grande échelle GPU en cluster Séries A4 et A3
Entraînement à grande échelle (plus de 500 milliards de paramètres) et inférence désagrégée GPU en cluster A4X Max, A4X, A4

Pour obtenir un arbre de décision détaillé qui mappe directement les architectures de modèles au matériel, consultez la section Choisir un accélérateur.

Une fois ces critères principaux établis, choisissez une plate-forme d'orchestration. Ce choix dépend de la préférence de votre équipe pour la gestion automatisée ou le contrôle précis du système d'exploitation et des pilotes.

Étape suivante