AI Hypercomputer propose plusieurs options de consommation pour acquérir des ressources de calcul. Ces options répondent à des besoins tels que la durée de la charge de travail, la tolérance aux pannes et le modèle d'infrastructure. Découvrez ces options et choisissez celle qui convient le mieux à votre cas d'utilisation.
Présentation des options de consommation
Pour comparer les options de consommation en fonction des caractéristiques clés, consultez le tableau suivant :
| Option d'utilisation | Modèle de provisionnement | Application idéale | Garantie de capacité | Durée de vie | Préemptif | Quota | Remises | Modèle d'allocation |
|---|---|---|---|---|---|---|---|---|
| Démarrage flexible | Démarrage flexible | Charges de travail de courte durée (jusqu'à sept jours) qui peuvent attendre que la capacité soit disponible. | Optimisation limitée | Jusqu'à sept jours | Non | Quota préemptif | Remise (jusqu'à 53%) sur les séries compatibles | Dense pour les requêtes de redimensionnement de MIG ; optimisation limitée pour les VM autonomes. |
| VM Spot | Spot | Charges de travail GPU générales de courte durée et tolérantes aux pannes. | Optimisation limitée | Préemptif | Oui | Quota préemptif | Remise importante (jusqu'à 91%) | Standard |
| Réservations standards | Standard | Charges de travail GPU générales critiques qui nécessitent un très haut niveau d'assurance de capacité. | Très élevée | Très élevée | Définie par l'utilisateur | Non | Aucun quota consommé | Tarifs réduits avec des remises sur engagement d'utilisation |
| Réservations futures pour les blocs de capacité | Liée à la réservation | Entraînement à grande échelle et de longue durée sur un GPU en cluster. | Très élevée | Illimité pendant la période de réservation. | Non | Augmentation automatique | Remise (jusqu'à 53%) avec des remises sur engagement d'utilisation | Dense |
| Réservations futures en mode Agenda | Liée à la réservation | Charges de travail GPU en cluster jusqu'à 90 jours qui nécessitent une capacité réservée. | Très élevée | Jusqu'à 90 jours | Non | Aucun quota consommé | Remise (jusqu'à 53%) | Dense |
| VM à la demande | Standard | Charges de travail GPU générales sans durée spécifique. | Optimisation limitée | Illimité | Non | Quota à la demande | Aucune (paiement à l'usage) | Standard |
L'option de consommation que vous utilisez pour déployer votre infrastructure dépend de si vous utilisez un GPU général ou un GPU en cluster.
GPU général : conçu pour l'inférence à petite échelle , le développement et les charges de travail d'entraînement à plus petite échelle. Ce type de GPU offre une flexibilité opérationnelle grâce à la maintenance asynchrone. Pour afficher les options disponibles, consultez Options de consommation pour les GPU généraux.
GPU en cluster : conçu pour les charges de travail d'entraînement à grande échelle, étroitement couplées, ainsi que pour les charges de travail d'inférence, d'apprentissage par renforcement et de modèles de raisonnement à grande échelle qui nécessitent une assurance de capacité élevée et une allocation dense des ressources pour minimiser la latence du réseau. Pour afficher les options disponibles, consultez Options de consommation pour les GPU en cluster.
Options de consommation pour les GPU généraux
Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU généraux.
Utiliser le démarrage flexible
Pour exécuter des charges de travail de courte durée qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pendant sept jours maximum à l'aide du démarrage flexible. Lorsque des ressources sont disponibles, Compute Engine crée le nombre de VM demandé. Vous pouvez arrêter les VM à démarrage flexible autonomes, mais pas celles qu'un groupe d'instances géré (MIG) crée via des requêtes de redimensionnement. Les VM à démarrage flexible existent jusqu'à ce que vous les supprimiez ou que Compute Engine les supprime à la fin de leur durée d'exécution.
Charges de travail adaptées
- Pré-entraînement de petits modèles
- Affinage de modèles
- Simulation de calcul hautes performances (HPC)
- Inférence par lot
Principales caractéristiques
- Modèle de provisionnement : démarrage flexible.
- Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster à l'exception des A4X Max et A4X.
- Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 53% sur les processeurs virtuels, la mémoire, les GPU et les disques SSD locaux pour les séries de machines A4, A3, A2 et G4. Les tarifs à la demande standards s'appliquent aux autres séries compatibles. Pour en savoir plus, consultez Tarifs du démarrage flexible.
Utiliser Spot
Pour exécuter des charges de travail tolérantes aux pannes, vous pouvez obtenir des ressources de calcul immédiatement en fonction de la disponibilité. Vous obtenez des ressources au prix le plus bas possible. Toutefois, Compute Engine peut préempter des VM à tout moment pour récupérer de la capacité.
Charges de travail adaptées
- Traitement par lot et analyse de données
- Calcul hautes performances (HPC) et encodage multimédia
Principales caractéristiques
- Modèle de provisionnement : Spot.
- Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster à l'exception des A4X Max et A4X.
- Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les processeurs virtuels, la mémoire, les GPU, et les disques SSD locaux.
Utiliser à la demande
Conseil : Pour augmenter vos chances d'obtenir une capacité GPU générale, utilisez le démarrage flexible ou Spot. Ces options de consommation proposent des GPU à un prix réduit par rapport à la tarification à la demande. Elles ont été conçues pour vous aider à augmenter vos chances d'obtenir des ressources très demandées, comme des GPU.
Pour exécuter des charges de travail sans durée spécifique, vous pouvez obtenir des ressources de calcul immédiatement basées sur la disponibilité. Les VM s'exécutent jusqu'à ce que vous les arrêtiez ou les supprimiez.
Charges de travail adaptées
- Inférence et exécution de modèles
- Prototypage et tests
Principales caractéristiques
- Modèle de provisionnement : standard.
- Disponibilité immédiate : créez des instances de VM immédiatement sans attendre la planification ou l'approbation de la capacité.
- Tarification standard : payez les ressources aux tarifs à la demande standards sans engagement à long terme.
- Large compatibilité matérielle : utilisez-la avec n'importe quelle série de machines GPU compatible dans le chemin d'accès GPU général.
Utiliser les réservations standards
Pour exécuter des charges de travail GPU générales critiques qui nécessitent un très haut niveau d'assurance de capacité, vous pouvez utiliser des réservations standards.
Charges de travail adaptées
- Charges de travail de production critiques
- Charges de travail nécessitant une capacité assurée
Principales caractéristiques
- Modèle de provisionnement : standard.
- Garantie de capacité : offre une très haute assurance que les ressources sont disponibles.
- Tarification : les tarifs standards s'appliquent, mais vous pouvez associer des remises sur engagement d'utilisation pour réaliser des économies.
Options de consommation pour les GPU en cluster
Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU en cluster.Utiliser les réservations futures pour les blocs de capacité
Pour exécuter des charges de travail distribuées de longue durée et à grande échelle qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pour une durée spécifique à l'avenir. Vous disposez d'un accès exclusif à vos ressources réservées pendant cette période, et vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les opérations suivantes :
- Compute Engine supprime la réservation.
- En fonction de l' action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.
Charges de travail adaptées
- Pré-entraînement des modèles de fondation
- Inférence pour les modèles de fondation sur plusieurs hôtes
Principales caractéristiques
- Modèle de provisionnement : lié à la réservation.
- Compatibilité avec les machines premium : réservez des types de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPU).
- Exigences d'engagement : associez un engagement basé sur les ressources pour les réservations d'un an ou plus.
- Modifications dynamiques : activez les notifications de maintenance d'urgence matérielle pour l'utilisation des jobs Vertex AI après le début de la période.
Utiliser les réservations futures en mode Agenda
Pour exécuter des charges de travail distribuées de courte durée qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pendant 90 jours maximum. Vous disposez d'un accès exclusif à vos ressources réservées pendant cette période, et vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les opérations suivantes :
- Compute Engine supprime la réservation.
- En fonction de l' action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.
Charges de travail adaptées
- Pré-entraînement et affinage
- Simulations et inférences à grande échelle
Principales caractéristiques
- Modèle de provisionnement : lié à la réservation.
- Compatibilité avec les séries de machines : réservez des types de machines A4, A3 Ultra, A3 Mega ou A3 High (8 GPU) .
- Limites d'évolutivité : réservez jusqu'à 80 VM pendant 90 jours maximum.
- Provisionnement optimisé : utilisez un modèle lié à la réservation pour augmenter vos chances d’obtenir des GPU.
Utiliser le démarrage flexible
Utilisez le démarrage flexible pour les requêtes de redimensionnement de groupe d'instances géré (MIG) en cluster lorsque vous avez besoin de ressources à allocation dense pendant sept jours maximum.
Charges de travail adaptées
Les VM à démarrage flexible sont idéales pour exécuter des charges de travail qui peuvent démarrer à tout moment, par exemple :
- Pré-entraînement de petits modèles
- Affinage de modèles
- Simulation de calcul hautes performances (HPC)
- Inférence par lot
Principales caractéristiques
- Modèle de provisionnement : démarrage flexible.
- Allocation des ressources : allocation dense pour les requêtes de redimensionnement de MIG.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 53% sur les processeurs virtuels, la mémoire, les GPU, et tous les disques SSD locaux associés pour les séries de machines A4, A3, A2 et G4. Les tarifs à la demande standards s'appliquent aux autres séries compatibles.
Utiliser Spot
Vous pouvez utiliser des VM Spot pour les charges de travail tolérantes aux pannes à allocation dense afin de bénéficier de remises importantes, en sachant que Compute Engine peut préempter des VM pour récupérer de la capacité.
Charges de travail adaptées
- Entraînement distribué tolérant aux pannes
- Traitement par lot
Principales caractéristiques
- Modèle de provisionnement : Spot.
- Préemption : Compute Engine peut préempter des instances à tout moment.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les processeurs virtuels, la mémoire, les GPU, et tous les disques SSD locaux associés.
Étape suivante
- Pour identifier les besoins de votre charge de travail, consultez Identifier les besoins de votre charge de travail.
- Pour créer et utiliser des réservations, consultez Créer et utiliser des réservations.
- Pour en savoir plus sur les VM Spot, consultez En savoir plus sur les VM Spot.
- Pour créer une instance de VM à la demande, consultez Créer une instance de VM instance.