Options de consommation de AI Hypercomputer

AI Hypercomputer propose plusieurs options de consommation pour acquérir des ressources de calcul. Ces options répondent à des besoins tels que la durée de la charge de travail, la tolérance aux pannes et le modèle d'infrastructure. Découvrez ces options et choisissez celle qui convient le mieux à votre cas d'utilisation.

Présentation des options de consommation

Pour comparer les options de consommation en fonction des caractéristiques clés, consultez le tableau suivant :

Option d'utilisation Modèle de provisionnement Application idéale Garantie de capacité Durée de vie Préemptif Quota Remises Modèle d'allocation
Démarrage flexible Démarrage flexible Charges de travail de courte durée (jusqu'à sept jours) qui peuvent attendre que la capacité soit disponible. Optimisation limitée Jusqu'à sept jours Non Quota préemptif Remise (jusqu'à 53%) sur les séries compatibles Dense pour les requêtes de redimensionnement de MIG ; optimisation limitée pour les VM autonomes.
VM Spot Spot Charges de travail GPU générales de courte durée et tolérantes aux pannes. Optimisation limitée Préemptif Oui Quota préemptif Remise importante (jusqu'à 91%) Standard
Réservations standards Standard Charges de travail GPU générales critiques qui nécessitent un très haut niveau d'assurance de capacité. Très élevée Très élevée Définie par l'utilisateur Non Aucun quota consommé Tarifs réduits avec des remises sur engagement d'utilisation
Réservations futures pour les blocs de capacité Liée à la réservation Entraînement à grande échelle et de longue durée sur un GPU en cluster. Très élevée Illimité pendant la période de réservation. Non Augmentation automatique Remise (jusqu'à 53%) avec des remises sur engagement d'utilisation Dense
Réservations futures en mode Agenda Liée à la réservation Charges de travail GPU en cluster jusqu'à 90 jours qui nécessitent une capacité réservée. Très élevée Jusqu'à 90 jours Non Aucun quota consommé Remise (jusqu'à 53%) Dense
VM à la demande Standard Charges de travail GPU générales sans durée spécifique. Optimisation limitée Illimité Non Quota à la demande Aucune (paiement à l'usage) Standard

L'option de consommation que vous utilisez pour déployer votre infrastructure dépend de si vous utilisez un GPU général ou un GPU en cluster.

  • GPU général : conçu pour l'inférence à petite échelle , le développement et les charges de travail d'entraînement à plus petite échelle. Ce type de GPU offre une flexibilité opérationnelle grâce à la maintenance asynchrone. Pour afficher les options disponibles, consultez Options de consommation pour les GPU généraux.

  • GPU en cluster : conçu pour les charges de travail d'entraînement à grande échelle, étroitement couplées, ainsi que pour les charges de travail d'inférence, d'apprentissage par renforcement et de modèles de raisonnement à grande échelle qui nécessitent une assurance de capacité élevée et une allocation dense des ressources pour minimiser la latence du réseau. Pour afficher les options disponibles, consultez Options de consommation pour les GPU en cluster.

Options de consommation pour les GPU généraux

Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU généraux.

Utiliser le démarrage flexible

Pour exécuter des charges de travail de courte durée qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pendant sept jours maximum à l'aide du démarrage flexible. Lorsque des ressources sont disponibles, Compute Engine crée le nombre de VM demandé. Vous pouvez arrêter les VM à démarrage flexible autonomes, mais pas celles qu'un groupe d'instances géré (MIG) crée via des requêtes de redimensionnement. Les VM à démarrage flexible existent jusqu'à ce que vous les supprimiez ou que Compute Engine les supprime à la fin de leur durée d'exécution.

Charges de travail adaptées

  • Pré-entraînement de petits modèles
  • Affinage de modèles
  • Simulation de calcul hautes performances (HPC)
  • Inférence par lot

Principales caractéristiques

  • Modèle de provisionnement : démarrage flexible.
  • Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster à l'exception des A4X Max et A4X.
  • Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 53% sur les processeurs virtuels, la mémoire, les GPU et les disques SSD locaux pour les séries de machines A4, A3, A2 et G4. Les tarifs à la demande standards s'appliquent aux autres séries compatibles. Pour en savoir plus, consultez Tarifs du démarrage flexible.

Utiliser Spot

Pour exécuter des charges de travail tolérantes aux pannes, vous pouvez obtenir des ressources de calcul immédiatement en fonction de la disponibilité. Vous obtenez des ressources au prix le plus bas possible. Toutefois, Compute Engine peut préempter des VM à tout moment pour récupérer de la capacité.

Charges de travail adaptées

  • Traitement par lot et analyse de données
  • Calcul hautes performances (HPC) et encodage multimédia

Principales caractéristiques

  • Modèle de provisionnement : Spot.
  • Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster à l'exception des A4X Max et A4X.
  • Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les processeurs virtuels, la mémoire, les GPU, et les disques SSD locaux.

Utiliser à la demande

Conseil : Pour augmenter vos chances d'obtenir une capacité GPU générale, utilisez le démarrage flexible ou Spot. Ces options de consommation proposent des GPU à un prix réduit par rapport à la tarification à la demande. Elles ont été conçues pour vous aider à augmenter vos chances d'obtenir des ressources très demandées, comme des GPU.

Pour exécuter des charges de travail sans durée spécifique, vous pouvez obtenir des ressources de calcul immédiatement basées sur la disponibilité. Les VM s'exécutent jusqu'à ce que vous les arrêtiez ou les supprimiez.

Charges de travail adaptées

  • Inférence et exécution de modèles
  • Prototypage et tests

Principales caractéristiques

  • Modèle de provisionnement : standard.
  • Disponibilité immédiate : créez des instances de VM immédiatement sans attendre la planification ou l'approbation de la capacité.
  • Tarification standard : payez les ressources aux tarifs à la demande standards sans engagement à long terme.
  • Large compatibilité matérielle : utilisez-la avec n'importe quelle série de machines GPU compatible dans le chemin d'accès GPU général.

Utiliser les réservations standards

Pour exécuter des charges de travail GPU générales critiques qui nécessitent un très haut niveau d'assurance de capacité, vous pouvez utiliser des réservations standards.

Charges de travail adaptées

  • Charges de travail de production critiques
  • Charges de travail nécessitant une capacité assurée

Principales caractéristiques

  • Modèle de provisionnement : standard.
  • Garantie de capacité : offre une très haute assurance que les ressources sont disponibles.
  • Tarification : les tarifs standards s'appliquent, mais vous pouvez associer des remises sur engagement d'utilisation pour réaliser des économies.

Options de consommation pour les GPU en cluster

Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU en cluster.

Utiliser les réservations futures pour les blocs de capacité

Pour exécuter des charges de travail distribuées de longue durée et à grande échelle qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pour une durée spécifique à l'avenir. Vous disposez d'un accès exclusif à vos ressources réservées pendant cette période, et vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les opérations suivantes :

  • Compute Engine supprime la réservation.
  • En fonction de l' action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.

Charges de travail adaptées

  • Pré-entraînement des modèles de fondation
  • Inférence pour les modèles de fondation sur plusieurs hôtes

Principales caractéristiques

  • Modèle de provisionnement : lié à la réservation.
  • Compatibilité avec les machines premium : réservez des types de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPU).
  • Exigences d'engagement : associez un engagement basé sur les ressources pour les réservations d'un an ou plus.
  • Modifications dynamiques : activez les notifications de maintenance d'urgence matérielle pour l'utilisation des jobs Vertex AI après le début de la période.

Utiliser les réservations futures en mode Agenda

Pour exécuter des charges de travail distribuées de courte durée qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pendant 90 jours maximum. Vous disposez d'un accès exclusif à vos ressources réservées pendant cette période, et vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les opérations suivantes :

  • Compute Engine supprime la réservation.
  • En fonction de l' action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.

Charges de travail adaptées

  • Pré-entraînement et affinage
  • Simulations et inférences à grande échelle

Principales caractéristiques

  • Modèle de provisionnement : lié à la réservation.
  • Compatibilité avec les séries de machines : réservez des types de machines A4, A3 Ultra, A3 Mega ou A3 High (8 GPU) .
  • Limites d'évolutivité : réservez jusqu'à 80 VM pendant 90 jours maximum.
  • Provisionnement optimisé : utilisez un modèle lié à la réservation pour augmenter vos chances d’obtenir des GPU.

Utiliser le démarrage flexible

Utilisez le démarrage flexible pour les requêtes de redimensionnement de groupe d'instances géré (MIG) en cluster lorsque vous avez besoin de ressources à allocation dense pendant sept jours maximum.

Charges de travail adaptées

Les VM à démarrage flexible sont idéales pour exécuter des charges de travail qui peuvent démarrer à tout moment, par exemple :

  • Pré-entraînement de petits modèles
  • Affinage de modèles
  • Simulation de calcul hautes performances (HPC)
  • Inférence par lot

Principales caractéristiques

  • Modèle de provisionnement : démarrage flexible.
  • Allocation des ressources : allocation dense pour les requêtes de redimensionnement de MIG.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 53% sur les processeurs virtuels, la mémoire, les GPU, et tous les disques SSD locaux associés pour les séries de machines A4, A3, A2 et G4. Les tarifs à la demande standards s'appliquent aux autres séries compatibles.

Utiliser Spot

Vous pouvez utiliser des VM Spot pour les charges de travail tolérantes aux pannes à allocation dense afin de bénéficier de remises importantes, en sachant que Compute Engine peut préempter des VM pour récupérer de la capacité.

Charges de travail adaptées

  • Entraînement distribué tolérant aux pannes
  • Traitement par lot

Principales caractéristiques

  • Modèle de provisionnement : Spot.
  • Préemption : Compute Engine peut préempter des instances à tout moment.
  • Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les processeurs virtuels, la mémoire, les GPU, et tous les disques SSD locaux associés.

Étape suivante