AI Hypercomputer propose plusieurs options de consommation pour acquérir des ressources de calcul. Ces options répondent à des besoins tels que la durée de la charge de travail, la tolérance aux pannes et le modèle d'infrastructure. Découvrez ces options et choisissez celle qui convient le mieux à votre cas d'utilisation.
Au lieu d'effectuer une évaluation manuelle, vous pouvez demander à Gemini dans la consoleGoogle Cloud de comparer les options de consommation pour votre charge de travail et votre budget. Pour en savoir plus, consultez Concevoir une infrastructure d'IA avec Compute Advisor.
Présentation des options de consommation
Pour comparer les options de consommation selon les principales caractéristiques, consultez le tableau suivant :
| Option d'utilisation | Modèle de provisionnement | Application idéale | Garantie de capacité | Durée de vie | Préemptif | Quota | Remises | Modèle d'allocation |
|---|---|---|---|---|---|---|---|---|
| Démarrage flexible | Démarrage flexible | Charges de travail de courte durée (jusqu'à sept jours) qui peuvent attendre que la capacité soit disponible. | Optimisation limitée | Jusqu'à sept jours | Non | Quota préemptif | Remise (jusqu'à 53%) sur les séries compatibles | Dense pour les demandes de redimensionnement de MIG ; au mieux pour les VM autonomes. |
| VM Spot | Spot | Charges de travail GPU générales de courte durée et tolérantes aux pannes. | Optimisation limitée | Préemptif | Oui | Quota préemptif | Fortement remisés (jusqu'à 91%) | Standard |
| Réservations standards | Standard | Charges de travail GPU générales critiques nécessitant un très haut niveau d'assurance de disponibilité de la capacité. | Très élevée | Très élevée | Définie par l'utilisateur | Non | Aucun quota consommé | Tarifs réduits avec les remises sur engagement d'utilisation |
| Réservations futures pour les blocs de capacité | Lié à la réservation | Entraînement à grande échelle et de longue durée sur un GPU en cluster. | Très élevée | Illimité pendant la période de réservation. | Non | Le quota est augmenté avant la diffusion | Remise (jusqu'à 53%) avec les CUD | Dense |
| Réservations futures en mode Agenda | Lié à la réservation | Charges de travail GPU en cluster jusqu'à 90 jours nécessitant une capacité réservée. | Très élevée | Jusqu'à 90 jours | Non | Aucun quota consommé | Avec remise (jusqu'à 53%) | Dense |
| VM à la demande | Standard | charges de travail GPU générales sans durée spécifique. | Optimisation limitée | Illimité | Non | Quota à la demande | Aucun (paiement à l'usage) | Standard |
L'option de consommation que vous utilisez pour déployer votre infrastructure dépend de l'utilisation de GPU généraux ou de GPU en cluster.
GPU général : conçu pour les charges de travail d'inférence, de développement et d'entraînement à petite échelle. Ce type de GPU offre une flexibilité opérationnelle grâce à la maintenance asynchrone. Pour afficher les options disponibles, consultez Options de consommation pour les GPU généraux.
GPU en cluster : conçu pour les charges de travail d'entraînement à grande échelle et étroitement couplées, ainsi que pour les charges de travail d'inférence, d'apprentissage par renforcement et de modélisation du raisonnement à grande échelle, qui nécessitent une assurance de capacité élevée et une allocation de ressources dense pour minimiser la latence du réseau. Pour afficher les options disponibles, consultez Options de consommation pour les GPU en cluster.
Options de consommation pour les GPU à usage général
Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU généraux.
Utiliser le démarrage flexible
Pour exécuter des charges de travail de courte durée nécessitant des ressources allouées de manière dense, vous pouvez demander des ressources de calcul pendant sept jours maximum à l'aide du démarrage flexible. Chaque fois que des ressources sont disponibles, Compute Engine crée le nombre de VM demandé. Vous pouvez arrêter les VM à démarrage flexible autonomes, mais pas celles qu'un groupe d'instances gérées (MIG) crée par le biais de demandes de redimensionnement. Les VM à démarrage flexible existent jusqu'à ce que vous les supprimiez ou jusqu'à ce que Compute Engine les supprime à la fin de leur durée d'exécution.
Charges de travail adaptées
- Pré-entraînement de petits modèles
- Affinage de modèles
- Simulation de calcul hautes performances (HPC)
- Inférence par lot
Principales caractéristiques
- Modèle de provisionnement : "Démarrage flexible".
- Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster, à l'exception d'A4X Max et A4X.
- Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 53% sur les vCPU, la mémoire, les GPU et les disques SSD locaux pour les séries de machines A4, A3, A2 et G4. Les tarifs standards à la demande s'appliquent aux autres séries compatibles. Pour en savoir plus, consultez Tarifs de démarrage flexible.
Utiliser Spot
Pour exécuter des charges de travail tolérantes aux pannes, vous pouvez obtenir des ressources de calcul immédiatement en fonction de leur disponibilité. Vous obtenez des ressources au prix le plus bas possible. Toutefois, Compute Engine peut préempter des VM à tout moment pour récupérer de la capacité.
Charges de travail adaptées
- Traitement par lot et analyse de données
- Calcul hautes performances (HPC) et encodage multimédia
Principales caractéristiques
- Modèle de provisionnement : Spot.
- Large compatibilité matérielle : demandez n'importe quel type de machine GPU en cluster, à l'exception d'A4X Max et A4X.
- Optimisation de la latence : appliquez une stratégie d'emplacement compact aux VM autonomes pour minimiser la latence du réseau.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les vCPU, la mémoire, les GPU et les disques SSD locaux.
Utiliser à la demande
Conseil : Pour augmenter vos chances d'obtenir une capacité GPU générale, utilisez le démarrage flexible ou les VM Spot. Ces options de consommation proposent des GPU à un prix réduit par rapport aux prix à la demande. Elles ont été conçues pour vous aider à augmenter vos chances d'obtenir des ressources très demandées, comme des GPU.
Pour exécuter des charges de travail sans durée spécifique, vous pouvez obtenir des ressources de calcul immédiatement en fonction de leur disponibilité. Les VM s'exécutent jusqu'à ce que vous les arrêtiez ou les supprimiez.
Charges de travail adaptées
- Inférence et mise en service de modèles
- Prototypage et expérimentation
Principales caractéristiques
- Modèle de provisionnement : standard.
- Disponibilité immédiate : créez des instances de VM immédiatement, sans attendre la planification ou l'approbation de la capacité.
- Tarification standard : payez les ressources aux tarifs standards à la demande, sans engagement à long terme.
- Compatibilité matérielle étendue : utilisez-le avec n'importe quelle série de machines GPU compatibles dans le chemin d'accès GPU général.
Utiliser les réservations standards
Pour exécuter des charges de travail GPU générales critiques qui nécessitent un très haut niveau d'assurance de capacité, vous pouvez utiliser des réservations standards.
Charges de travail adaptées
- Charges de travail de production critiques
- Charges de travail nécessitant une capacité assurée
Principales caractéristiques
- Modèle de provisionnement : standard.
- Garantie de capacité : offre une très grande assurance que les ressources sont disponibles.
- Tarifs : les tarifs standards s'appliquent, mais vous pouvez associer des remises sur engagement d'utilisation pour faire des économies.
Options de consommation pour les GPU en cluster
Utilisez les options de consommation suivantes pour acquérir de la capacité pour les GPU en cluster.
Utiliser les réservations futures pour les blocs de capacité
Pour exécuter des charges de travail distribuées de longue durée et à grande échelle qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul à allocation dense pour une date et une heure ultérieures. Vous bénéficiez d'un accès exclusif aux ressources réservées pendant cette période. Vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les actions suivantes :
- Compute Engine supprime la réservation et tout pool de stockage vide associé.
- En fonction de l'action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.
Charges de travail adaptées
- Pré-entraînement des modèles de fondation
- Inférence pour les modèles de fondation sur plusieurs hôtes
Principales caractéristiques
- Modèle de provisionnement : lié à la réservation.
- Prise en charge des machines Premium : réservez des types de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPU).
- Réservations Hyperdisk : vous pouvez réserver un pool de stockage Hyperdisk ou un pool étendu Hyperdisk avec une capacité de calcul pour vous assurer que vos charges de travail disposent de ressources de stockage suffisantes. Google colocalise les pools Hyperdisk avec vos nœuds de calcul pour optimiser les performances de stockage.
- Exigences concernant les engagements : associez un engagement basé sur les ressources pour les réservations d'un an ou plus afin de bénéficier de remises sur les ressources de calcul et les pools Hyperdisk.
- Modifications dynamiques : activez les notifications de maintenance d'urgence du matériel pour l'utilisation des jobs Vertex AI après le début de la période.
Utiliser les réservations futures en mode Agenda
Pour exécuter des charges de travail distribuées de courte durée qui nécessitent des ressources à allocation dense, vous pouvez demander des ressources de calcul pour une durée maximale de 90 jours. Vous bénéficiez d'un accès exclusif aux ressources réservées pendant cette période. Vous pouvez les utiliser pour créer des VM ou des clusters. À la fin de la période de réservation, Compute Engine effectue les opérations suivantes :
- Compute Engine supprime la réservation.
- En fonction de l'action d'arrêt que vous spécifiez pour les VM, Compute Engine arrête ou supprime toutes les VM qui utilisent la réservation.
Charges de travail adaptées
- Pré-entraînement et affinage
- Simulations et inférences à grande échelle
Principales caractéristiques
- Modèle de provisionnement : lié à la réservation.
- Compatibilité avec les séries de machines : réservez des types de machines A4, A3 Ultra, A3 Mega ou A3 High (8 GPU).
- Limites de scalabilité : réservez jusqu'à 80 VM pendant 90 jours maximum.
- Provisionnement optimisé : utilisez un modèle lié à une réservation pour augmenter vos chances d'obtenir des GPU.
Utiliser le démarrage flexible
Utilisez le démarrage flexible pour les demandes de redimensionnement de groupe d'instances géré (MIG) en cluster lorsque vous avez besoin de ressources allouées de manière dense pendant sept jours maximum.
Charges de travail adaptées
Les VM à démarrage flexible sont idéales pour exécuter des charges de travail qui peuvent démarrer à tout moment, comme les suivantes :
- Pré-entraînement de petits modèles
- Affinage de modèles
- Simulation de calcul hautes performances (HPC)
- Inférence par lot
Principales caractéristiques
- Modèle de provisionnement : "Démarrage flexible".
- Allocation des ressources : allocation dense pour les demandes de redimensionnement de MIG.
- Rentabilité : vous bénéficiez d'une remise allant jusqu'à 53% sur les vCPU, la mémoire, les GPU et les disques SSD locaux associés pour les séries de machines A4, A3, A2 et G4. Les tarifs standards à la demande s'appliquent aux autres séries de machines compatibles.
Utiliser Spot
Vous pouvez utiliser des VM Spot pour les charges de travail tolérantes aux pannes à allocation dense afin de bénéficier de remises importantes, en sachant que Compute Engine peut préempter des VM pour récupérer de la capacité.
Charges de travail adaptées
- Entraînement distribué tolérant aux pannes
- Traitement par lot
Principales caractéristiques
- Modèle de provisionnement : Spot.
- Préemption : Compute Engine peut préempter des instances à tout moment.
- Rentabilité : bénéficiez d'une remise allant jusqu'à 91% sur les vCPU, la mémoire, les GPU et les disques SSD locaux associés.
Étapes suivantes
- Pour examiner le processus et les choix à faire lorsque vous démarrez un cluster, consultez Planifier et créer votre infrastructure d'IA.
- Pour créer et utiliser des réservations, consultez Créer et utiliser des réservations.
- Pour en savoir plus sur les VM Spot, consultez En savoir plus sur les VM Spot.
- Pour créer une instance de VM à la demande, consultez Créer une instance de VM à la demande.