Comprendre les GPU

Les processeurs graphiques (GPU) sont des accélérateurs matériels spécialisés conçus pour traiter simultanément des charges de travail massivement parallèles. SurGoogle Cloud, vous pouvez associer des GPU NVIDIA à des instances Compute Engine et à des instances bare metal pour accélérer les charges de travail exigeantes, telles que l'entraînement à l'intelligence artificielle (IA) et au machine learning (ML), le calcul hautes performances (HPC), le rendu graphique et le transcodage vidéo.

Ce document présente les GPU dans Google Cloud, y compris les modèles de GPU disponibles, les mappages des séries de machines, les caractéristiques de performances, les cas d'utilisation idéaux et les considérations tarifaires.

Qu'est-ce qu'un GPU ?

Un GPU est un processeur massivement parallèle qui a été initialement conçu pour les graphiques informatiques et qui est devenu un moteur de calcul essentiel pour l'IA, le ML et l'informatique scientifique. Contrairement aux unités centrales de traitement (CPU), qui contiennent quelques cœurs puissants optimisés pour le traitement séquentiel et monothread, les GPU se composent de milliers de cœurs plus petits et très efficaces conçus pour effectuer des calculs mathématiques simultanément sur de grands ensembles de données.

Voici les principaux composants architecturaux d'un système GPU :

  • Cœurs CUDA : unités de traitement vectoriel à usage général qui exécutent des instructions sur plusieurs threads parallèles simultanément à l'aide d'une architecture SIMT (Single Instruction, Multiple Threads). Les cœurs CUDA gèrent les calculs vectoriels et à virgule flottante standards (tels que FP32 et FP64), ainsi que le rendu graphique général et les simulations physiques.

  • Cœurs Tensor : unités de traitement spécialisées dans la multiplication et l'accumulation matricielles (MMA, Matrix Multiply-Accumulate), conçues pour accélérer les calculs des réseaux de neurones. Les cœurs Tensor offrent des accélérations exponentielles pour l'entraînement et l'inférence de l'IA dans différents formats de précision numérique spécialisés, y compris FP4, FP8, INT8, TF32 et FP16/BF16.

  • Mémoire à haut débit : mémoire dédiée sur l'appareil qui offre une bande passante pouvant atteindre plusieurs téraoctets par seconde (To/s), comme la mémoire à haut débit (HBM) ou la mémoire GDDR (Graphics Double Data Rate). Ce haut débit permet d'alimenter en données des milliers de cœurs de GPU lors d'opérations matricielles intensives.

  • Interconnexions à haut débit (NVLink et NVSwitch) : technologies d'interconnexion à bande passante élevée et à faible latence qui connectent plusieurs GPU sur le même serveur ou sur plusieurs nœuds. NVLink permet une communication directe entre les GPU, en contournant le bus PCIe plus lent. Les clusters de GPU peuvent ainsi fonctionner comme un pool de mémoire d'accélérateur unique et cohérent.

  • Logiciel de poste de travail virtuel (NVIDIA RTX vWS) : logiciel d'entreprise qui fournit une accélération graphique virtualisée pour les postes de travail visuels à distance, la conception assistée par ordinateur (CAO), la création de contenu numérique et la modélisation 3D.

Modèles de GPU et séries de machines

Google Cloud propose des GPU NVIDIA de plusieurs générations pour répondre à différents besoins en termes de charge de travail et de budget. Sur Compute Engine, les GPU sont disponibles sous forme de séries de machines optimisées pour les accélérateurs préconfigurées (séries A et G) ou d'accélérateurs pouvant être associés aux séries de machines à usage général (N1).

Le tableau suivant récapitule les spécifications matérielles, les mappages des séries de machines, la bande passante réseau et les capacités de stockage des modèles de GPU disponibles sur Compute Engine :

Modèle GPU Série de machines Architecture Mémoire et bande passante du GPU GPU par instance de calcul Bande passante réseau maximale SSD local Interconnexion Compatibilité avec les postes de travail virtuels (vWS) NVIDIA RTX
NVIDIA GB300 A4X Max Blackwell Ultra 279 Go HBM3e (8 Tbit/s) 4 (NVL72) 3 600 Gbit/s 12 000 Gio NVLink Full Mesh (1 800 Go/s) Non
NVIDIA GB200 A4X Blackwell 186 Go HBM3e (8 Tbit/s) 4 (NVL72) 2 000 Gbit/s 12 000 Gio NVLink Full Mesh (1 800 Go/s) Non
NVIDIA B200 A4 Blackwell 180 Go HBM3e (8 Tbit/s) 8 3 600 Gbit/s 12 000 Gio NVLink Full Mesh (1 800 Go/s) Non
NVIDIA H200 A3 Ultra Trémie 141 Go HBM3e (4,8 Tbit/s) 8 3 600 Gbit/s 12 000 Gio NVLink Full Mesh (900 Gbit/s) Non
NVIDIA H100 A3 Mega, High et Edge Trémie 80 Go HBM3 (3,35 Tbit/s) 1, 2, 4, 8 Jusqu'à 1 000 Gbit/s Jusqu'à 6 000 Gio NVLink Full Mesh (900 Gbit/s) Non
NVIDIA A100 (80 Go) A2 ultra Ampère 80 Go HBM2e (1,9 Tbit/s) 1, 2, 4, 8 100 Gbit/s Jusqu'à 3 000 Gio NVLink Full Mesh (600 Gbit/s) Non
NVIDIA A100 (40 Go) A2 Standard Ampère 40 Go HBM2 (1,6 Tbit/s) 1, 2, 4, 8, 16 100 Gbit/s Jusqu'à 3 000 Gio NVLink Full Mesh (600 Gbit/s) Non
NVIDIA RTX PRO 6000 G4 Blackwell 96 Go GDDR7 (1,597 Tbit/s) 1/8, 1/4, 1/2, 1, 2, 4, 8 200 Gbit/s Jusqu'à 3 000 Gio PCIe Gen 5 Oui
NVIDIA L4 G2 Ada Lovelace 24 Go GDDR6 (300 Go/s) 1, 2, 4, 8 100 Gbit/s Jusqu'à 3 000 Gio PCIe Gen 4 Oui
NVIDIA T4
(Fin de période de compatibilité bientôt atteinte)
N1+T4 Turing 16 Go GDDR6 (320 Go/s) 1, 2, 4 100 Gbit/s Compatible PCIe Gen 3 Oui
NVIDIA V100 N1+V100 Volta 16 Go HBM2 (900 Gbit/s) 1, 2, 4, 8 100 Gbit/s Compatible NVLink Ring (300 Gbit/s) Non
NVIDIA P100
(Fin de période de compatibilité)
N1+P100 Pascal 16 Go HBM2 (732 Gbit/s) 1, 2, 4 100 Gbit/s Compatible PCIe Gen 3 Oui
NVIDIA P4
(Fin de période de compatibilité bientôt atteinte)
N1+P4 Pascal 8 Go GDDR5 (192 Go/s) 1, 2, 4 100 Gbit/s Compatible PCIe Gen 3 Oui

Caractéristiques de performances des GPU

Le choix du bon modèle de GPU dépend des caractéristiques de calcul, des besoins en mémoire, des formats de précision et des besoins d'évolutivité de votre charge de travail.

Cas d'utilisation idéaux et exigences concernant la charge de travail

Les GPU accélèrent diverses charges de travail de calcul dans les domaines de l'IA, de l'informatique visuelle et de la modélisation scientifique. Pour comprendre les exigences architecturales de chaque catégorie de charge de travail, sélectionnez l'un des onglets suivants :

Entraînement par IA/ML

Inférence d'IA/de ML

  • Inférence de grands modèles (plus de 70 milliards de paramètres) : la diffusion de grands modèles de langage (LLM) massifs bénéficie d'une grande capacité de mémoire à haute bande passante (HBM3e) (141 à 186 Go par GPU) pour adapter les pondérations du modèle à un nombre réduit de GPU, ce qui réduit la surcharge de communication entre les puces. Séries de machines recommandées :

  • Diffusion à haut débit et en temps réel : les requêtes interactives à faible latence, les réponses en streaming et la génération d'images utilisent des formats numériques quantifiés accélérés par le matériel, tels que la virgule flottante de 8 bits (FP8), l'entier de 8 bits (INT8) et l'entier de 4 bits (INT4), pour maximiser le débit de requêtes par euro. Série de machines recommandée :

    Pour en savoir plus, consultez Recommandations pour la diffusion d'inférences dans la documentation AI Hypercomputer.

Graphismes et calcul visuel

HPC et simulation

  • Simulation et modélisation scientifiques : les applications de dynamique moléculaire (comme GROMACS et AMBER), de mécanique des fluides numérique (CFD), de chimie quantique, d'astrophysique et de prévisions météorologiques nécessitent des performances élevées en virgule flottante double précision (FP64) 64 bits et une bande passante mémoire élevée. Série de machines recommandée :

    • A4X (NVIDIA GB200)
    • A4 (NVIDIA B200)
    • A3 (NVIDIA H100)
    • A2 (NVIDIA A100)

    Pour en savoir plus, consultez Recommandations pour le HPC dans la documentation AI Hypercomputer.

Considérations relatives à la charge de travail

Les GPU ne conviennent généralement pas aux charges de travail suivantes :

  • Logique séquentielle et monothread : les tâches dominées par des branches de décision séquentielles ou des pipelines d'exécution en série sont plus performantes sur les processeurs avec des fréquences d'horloge monocœur élevées.
  • Applications Web et microservices standards : les serveurs Web à usage général, les systèmes de gestion de bases de données relationnelles (SGBDR) et les backends d'API standards sans exigences de traitement de l'IA ou des graphiques ne bénéficient pas de l'accélération GPU. Ces charges de travail sont hébergées de manière plus économique sur des instances de CPU à usage général ou optimisées pour le calcul.
  • Charges de travail optimisées pour XLA et les frameworks compilés par graphe : si vos modèles de deep learning sont créés à l'aide de frameworks tels que JAX, PyTorch/XLA ou TensorFlow, ils peuvent tirer parti des optimisations de graphe pilotées par le compilateur (XLA). Si vos modèles bénéficient également de tableaux systoliques matriciels personnalisés et de commutateurs de circuits optiques, envisagez d'évaluer d'autres architectures d'accélérateurs conçues pour ces paradigmes d'exécution spécifiques.

Remarques sur les tarifs

Les facteurs suivants déterminent le prix des GPU sur Google Cloud :

  • Modèle de GPU spécifique.

  • Nombre de GPU associés.

  • Ressources provisionnées, telles que les processeurs virtuels, la mémoire système et le stockage.

  • Le modèle de consommation que vous sélectionnez.

Les sections suivantes décrivent les modèles de consommation et les options de remise disponibles pour les GPU dans Google Cloud.

Modèles de consommation et d'achat

Vous pouvez provisionner des instances de GPU à l'aide de plusieurs options de consommation en fonction de vos exigences de disponibilité et de votre tolérance aux coûts :

  • À la demande : tarification standard de paiement à l'usage (PAYG) facturée à la seconde, sans engagement à long terme. Les instances à la demande offrent une flexibilité complète du cycle de vie pour le développement, les tests et les charges de travail de production variables.

  • VM Spot : instances de calcul à prix très réduit (jusqu'à 60 à 91% de remise sur les tarifs à la demande) qui utilisent la capacitéGoogle Cloud excédentaire. Étant donné que Google Cloud peut arrêter ou supprimer des VM Spot pour récupérer de la capacité avec un préavis de 30 secondes, ces instances de calcul sont idéales pour l'entraînement ML par lot tolérant aux pannes, les jobs par lot avec points de contrôle et le traitement de données distribué.

  • VM à démarrage flexible : option de planification dynamique reposant sur le programmeur de charge de travail dynamique (DWS, Dynamic Workload Scheduler) qui provisionne des ressources de GPU au cours d'une période spécifiée pour les charges de travail à durée fixe (jusqu'à sept jours) à des tarifs réduits.

  • Réservations :

    • Réservations : vous pouvez réserver de la capacité pour les GPU standards et l'utiliser immédiatement.
    • Réservations futures (mode Agenda et AI Hypercomputer) : vous pouvez demander à réserver de la capacité de GPU en cluster pour une date et une heure ultérieures. Si Google Cloud approuve votre demande, vous pouvez commencer à utiliser la capacité à l'heure spécifiée et conserver un accès exclusif jusqu'à la fin de la réservation.

Options de remise

  • Remises sur engagement d'utilisation : elles offrent des remises importantes (jusqu'à 55% pour les engagements de trois ans ou 37% pour les engagements d'un an) en échange d'un engagement à maintenir un niveau d'utilisation continu des ressources dans une région spécifique. Pour les types de machines optimisés pour les accélérateurs et les GPU associés, les remises sur engagement d'utilisation nécessitent l'achat d'engagements basés sur les ressources associés à des réservations.

  • Remises pour usage soutenu (SUD) : remises automatiques appliquées aux instances de calcul N1 et aux GPU associés lorsqu'ils sont exécutés pendant plus de 25% d'un mois de facturation. Les séries de machines optimisées pour les accélérateurs (séries A et G) ne reçoivent pas de SUD.

Pour connaître les tarifs horaires et mensuels détaillés dans toutes les régions, consultez les pages Tarifs des GPU et Tarifs des instances de VM.

Pour obtenir une matrice détaillée des fonctionnalités disponibles pour les options de consommation sur tous les types de machines d'accélérateur, consultez Options de consommation disponibles par type de machine.

Étapes suivantes