Options de consommation de AI Hypercomputer

AI Hypercomputer propose plusieurs options de consommation pour acquérir des ressources de calcul. Ces options répondent à des besoins tels que la durée de la charge de travail, la tolérance aux pannes et le modèle d'infrastructure. Découvrez ces options et choisissez celle qui convient le mieux à votre cas d'utilisation.

Au lieu d'effectuer une évaluation manuelle, vous pouvez demander à Gemini dans la consoleGoogle Cloud de comparer les options de consommation pour votre charge de travail et votre budget. Pour en savoir plus, consultez Concevoir une infrastructure d'IA avec Compute Advisor.

Présentation des options de consommation

Pour comparer les options de consommation selon les principales caractéristiques, consultez le tableau suivant :

Option d'utilisation Modèle de provisionnement Application idéale Garantie de capacité Durée de vie Préemptif Quota Remises Modèle d'allocation
Démarrage flexible Démarrage flexible Charges de travail de courte durée (jusqu'à sept jours) qui peuvent attendre que la capacité soit disponible. Optimisation limitée Jusqu'à sept jours Non Quota préemptif Remise (jusqu'à 53%) sur les séries compatibles Dense pour les demandes de redimensionnement de MIG ; au mieux pour les VM autonomes.
VM Spot Spot Charges de travail GPU générales de courte durée et tolérantes aux pannes. Optimisation limitée Préemptif Oui Quota préemptif Fortement remisés (jusqu'à 91%) Standard
Réservations standards Standard Charges de travail GPU générales critiques nécessitant un très haut niveau d'assurance de disponibilité de la capacité. Très élevée Très élevée Définie par l'utilisateur Non Aucun quota consommé Tarifs réduits avec les remises sur engagement d'utilisation
Réservations futures pour les blocs de capacité Lié à la réservation Entraînement à grande échelle et de longue durée sur un GPU en cluster. Très élevée Illimité pendant la période de réservation. Non Le quota est augmenté avant la diffusion Remise (jusqu'à 53%) avec les CUD Dense
Réservations futures en mode Agenda Lié à la réservation Charges de travail GPU en cluster jusqu'à 90 jours nécessitant une capacité réservée. Très élevée Jusqu'à 90 jours Non Aucun quota consommé Avec remise (jusqu'à 53%) Dense
VM à la demande Standard charges de travail GPU générales sans durée spécifique. Optimisation limitée Illimité Non Quota à la demande Aucun (paiement à l'usage) Standard

L'option de consommation que vous utilisez pour déployer votre infrastructure dépend de l'utilisation de GPU généraux ou de GPU en cluster.

  • GPU général : conçu pour les charges de travail d'inférence, de développement et d'entraînement à petite échelle. Ce type de GPU offre une flexibilité opérationnelle grâce à la maintenance asynchrone. Pour afficher les options disponibles, consultez Options de consommation pour les GPU généraux.

  • GPU en cluster : conçu pour les charges de travail d'entraînement à grande échelle et étroitement couplées, ainsi que pour les charges de travail d'inférence, d'apprentissage par renforcement et de modélisation du raisonnement à grande échelle, qui nécessitent une assurance de capacité élevée et une allocation de ressources dense pour minimiser la latence du réseau. Pour afficher les options disponibles, consultez Options de consommation pour les GPU en cluster.

Options de consommation pour les GPU à usage général

Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU généraux.

Utiliser le démarrage flexible

Pour exécuter des charges de travail de courte durée nécessitant des ressources allouées de manière dense, vous pouvez demander des ressources de calcul pendant sept jours maximum à l'aide du démarrage flexible. Chaque fois que des ressources sont disponibles, Compute Engine crée le nombre de VM demandé. Vous pouvez arrêter les VM à démarrage flexible autonomes, mais pas celles qu'un groupe d'instances gérées (MIG) crée par le biais de demandes de redimensionnement. Les VM à démarrage flexible existent jusqu'à ce que vous les supprimiez ou jusqu'à ce que Compute Engine les supprime à la fin de leur durée d'exécution.

Charges de travail adaptées

  • Pré-entraînement de petits modèles
  • Affinage de modèles
  • Simulation de calcul hautes performances (HPC)
  • Inférence par lot

Principales caractéristiques

  • Modèle de provisionnement : "Démarrage flexible".
  • Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster, à l'exception d'A4X Max et A4X.
  • Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 53% sur les vCPU, la mémoire, les GPU et les disques SSD locaux pour les séries de machines A4, A3, A2 et G4. Les tarifs standards à la demande s'appliquent aux autres séries compatibles. Pour en savoir plus, consultez Tarifs de démarrage flexible.

Utiliser Spot

Pour exécuter des charges de travail tolérantes aux pannes, vous pouvez obtenir des ressources de calcul immédiatement en fonction de leur disponibilité. Vous obtenez des ressources au prix le plus bas possible. Toutefois, Compute Engine peut préempter des VM à tout moment pour récupérer de la capacité.

Charges de travail adaptées

  • Traitement par lot et analyse de données
  • Calcul hautes performances (HPC) et encodage multimédia

Principales caractéristiques

  • Modèle de provisionnement : Spot.
  • Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster, à l'exception d'A4X Max et A4X.
  • Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les vCPU, la mémoire, les GPU et les disques SSD locaux.

Utiliser à la demande

Conseil : Pour augmenter vos chances d'obtenir une capacité GPU générale, utilisez le démarrage flexible ou les VM Spot. Ces options de consommation proposent des GPU à un prix réduit par rapport aux prix à la demande. Elles ont été conçues pour vous aider à augmenter vos chances d'obtenir des ressources très demandées, comme des GPU.

Pour exécuter des charges de travail sans durée spécifique, vous pouvez obtenir des ressources de calcul immédiatement en fonction de leur disponibilité. Les VM s'exécutent jusqu'à ce que vous les arrêtiez ou les supprimiez.

Charges de travail adaptées

  • Inférence et mise en service de modèles
  • Prototypage et expérimentation

Principales caractéristiques

  • Modèle de provisionnement : standard.
  • Disponibilité immédiate : créez des instances de VM immédiatement, sans attendre la planification ou l'approbation de la capacité.
  • Tarification standard : payez les ressources aux tarifs standards à la demande, sans engagement à long terme.
  • Compatibilité matérielle étendue : utilisez-le avec n'importe quelle série de machines GPU compatibles dans le chemin d'accès GPU général.

Utiliser les réservations standards

Pour exécuter des charges de travail GPU générales critiques qui nécessitent un très haut niveau d'assurance de capacité, vous pouvez utiliser des réservations standards.

Charges de travail adaptées

  • Charges de travail de production critiques
  • Charges de travail nécessitant une capacité assurée

Principales caractéristiques

  • Modèle de provisionnement : standard.
  • Garantie de capacité : offre une très grande assurance que les ressources sont disponibles.
  • Tarifs : les tarifs standards s'appliquent, mais vous pouvez associer des remises sur engagement d'utilisation pour faire des économies.

Options de consommation pour les GPU en cluster

Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU en cluster.

Utiliser les réservations futures pour les blocs de capacité

Pour exécuter des charges de travail distribuées de longue durée et à grande échelle qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul à allocation dense pour une date et une heure ultérieures. Vous bénéficiez d'un accès exclusif aux ressources réservées pendant cette période. Vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les actions suivantes :

  • Compute Engine supprime la réservation et tout pool de stockage vide associé.
  • En fonction de l'action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.

Charges de travail adaptées

  • Pré-entraînement des modèles de fondation
  • Inférence pour les modèles de fondation sur plusieurs hôtes

Principales caractéristiques

  • Modèle de provisionnement : lié à la réservation.
  • Prise en charge des machines Premium : réservez des types de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPU).
  • Réservations Hyperdisk : vous pouvez réserver un pool de stockage Hyperdisk ou un pool étendu Hyperdisk avec une capacité de calcul pour vous assurer que vos charges de travail disposent de ressources de stockage suffisantes. Google colocalise les pools Hyperdisk avec vos nœuds de calcul pour optimiser les performances de stockage.
  • Exigences concernant les engagements : associez un engagement basé sur les ressources pour les réservations d'un an ou plus afin de bénéficier de remises sur les ressources de calcul et les pools Hyperdisk.
  • Modifications dynamiques : activez les notifications de maintenance d'urgence du matériel pour l'utilisation des jobs Vertex AI après le début de la période.

Utiliser les réservations futures en mode Agenda

Pour exécuter des charges de travail distribuées de courte durée qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pour une durée maximale de 90 jours. Vous bénéficiez d'un accès exclusif aux ressources réservées pendant cette période. Vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les opérations suivantes :

  • Compute Engine supprime la réservation.
  • En fonction de l'action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.

Charges de travail adaptées

  • Pré-entraînement et affinage
  • Simulations et inférences à grande échelle

Principales caractéristiques

  • Modèle de provisionnement : lié à la réservation.
  • Compatibilité avec les séries de machines : réservez des types de machines A4, A3 Ultra, A3 Mega ou A3 High (8 GPU).
  • Limites de scalabilité : réservez jusqu'à 80 VM pendant 90 jours maximum.
  • Provisionnement optimisé : utilisez un modèle lié à une réservation pour augmenter vos chances d'obtenir des GPU.

Utiliser le démarrage flexible

Utilisez le démarrage flexible pour les demandes de redimensionnement de groupe d'instances géré (MIG) en cluster lorsque vous avez besoin de ressources allouées de manière dense pendant sept jours maximum.

Charges de travail adaptées

Les VM à démarrage flexible sont idéales pour exécuter des charges de travail qui peuvent démarrer à tout moment, comme les suivantes :

  • Pré-entraînement de petits modèles
  • Affinage de modèles
  • Simulation de calcul hautes performances (HPC)
  • Inférence par lot

Principales caractéristiques

  • Modèle de provisionnement : "Démarrage flexible".
  • Allocation des ressources : allocation dense pour les demandes de redimensionnement de MIG.
  • Rentabilité : vous bénéficiez d'une remise allant jusqu'à 53% sur les vCPU, la mémoire, les GPU et les disques SSD locaux associés pour les séries de machines A4, A3, A2 et G4. Les tarifs standards à la demande s'appliquent aux autres séries de machines compatibles.

Utiliser Spot

Vous pouvez utiliser des VM Spot pour les charges de travail tolérantes aux pannes à allocation dense afin de bénéficier de remises importantes, en sachant que Compute Engine peut préempter des VM pour récupérer de la capacité.

Charges de travail adaptées

  • Entraînement distribué tolérant aux pannes
  • Traitement par lot

Principales caractéristiques

  • Modèle de provisionnement : Spot.
  • Préemption : Compute Engine peut préempter des instances à tout moment.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les vCPU, la mémoire, les GPU et les disques SSD locaux associés.

Étapes suivantes