Les GPU en cluster, tels que les séries de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega, et A3 High (8 GPU), sont conçus pour vous permettre d'exécuter des clusters d'intelligence artificielle (IA) et de machine learning (ML) à grande échelle, et offrent les fonctionnalités de gestion de cluster suivantes :

La plupart des fonctionnalités de gestion de cluster ne sont compatibles qu'avec la capacité liée à la réservation, c'est-à-dire l'infrastructure qui utilise le modèle de provisionnement lié à la réservation, qui n'est compatible qu'avec les types de machines GPU en cluster. Pour la capacité qui utilise tout autre modèle de provisionnement, seules les fonctionnalités de gestion de cluster suivantes sont disponibles :

Colocation des ressources d'infrastructure d'IA

Lorsque vous utilisez des GPU en cluster, tels que les séries de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega et A3 High (8 GPU), vous pouvez demander des machines hôtes que Compute Engine provisionne aussi près que possible les unes des autres. Ces machines offrent les fonctionnalités suivantes :

Cette disposition des ressources réduit au maximum les sauts de réseau et permet d'obtenir la latence réseau la plus faible possible. Pour déployer des blocs de machines optimisées pour les accélérateurs que Compute Engine alloue de manière dense, vous pouvez utiliser les options suivantes :

Placement tenant compte de la topologie du cluster

Une fois que vous avez créé des GPU en cluster, vous pouvez obtenir des informations sur la topologie au niveau du nœud et du cluster. Ces informations vous aident à effectuer les opérations suivantes :

  • Ajustez la conception de votre application ou de votre charge de travail pour minimiser davantage la latence du réseau.

  • Comprenez et résolvez les problèmes de performances et de latence du réseau pour les instances qui communiquent fréquemment entre elles. Ces problèmes peuvent se produire si les instances sont plus éloignées que prévu.

Plus précisément, les informations sur la topologie sont compatibles comme suit :

  • Les informations sur la topologie fonctionnent mieux avec la capacité liée à la réservation, qui est requise pour afficher la topologie d'une réservation.

  • Pour les VM Spot, les informations sur la topologie ne s'affichent que lorsqu'une machine utilise une stratégie d'emplacement compact ou une stratégie de charge de travail.

Pour en savoir plus, consultez les ressources suivantes :

Mode de fonctionnement du cluster

Lorsque vous réservez une capacité liée à la réservation pour créer des instances de calcul ou des clusters, le type de machine que vous réservez détermine le mode de fonctionnement du cluster pour les instances. Ce mode spécifie le comportement de vos instances après des erreurs d'hôte ou des rapports d'hôte défectueux. Les modes de fonctionnement disponibles pour une instance sont le mode géré, dans lequel Compute Engine remplace automatiquement toutes les machines défectueuses mais retient une partie de votre capacité réservée pour fournir à vos instances les ressources nécessaires au redémarrage. Ou le mode pleine capacité, dans lequel vous avez accès à l'intégralité de votre capacité réservée, mais vous êtes responsable de la gestion des défaillances et de la maintenance planifiée.

Pour en savoir plus, consultez la section Mode de fonctionnement des réservations.

Planification et contrôles de la maintenance du cluster

Vous contrôlez la maintenance des GPU en cluster à l'aide de la planification tenant compte de la topologie dans un bloc de ressources. Cette fonctionnalité permet de synchroniser les mises à niveau afin que vos charges de travail soient plus résilientes aux événements hôtes et de minimiser les perturbations. Cette approche permet d'améliorer le débit utile de votre charge de travail.

Pour faciliter le contrôle total des événements de maintenance, vous pouvez utiliser les fonctionnalités suivantes :

Type de planification de la maintenance

Lorsque vous réservez une capacité liée à la réservation pour créer des instances de calcul ou des clusters de GPU en cluster, vous pouvez définir la façon dont Compute Engine gère l'infrastructure sur laquelle vos instances s'exécutent. En fonction du type de machine que vous souhaitez utiliser pour vos instances, vous pouvez choisir entre une maintenance synchronisée sur toutes les instances (groupée) ou des calendriers de maintenance différents (indépendants).

Pour en savoir plus, consultez la section Types de planification de la maintenance.

Gérer les événements hôtes

Une fois que vous avez créé des GPU en cluster et démarré votre charge de travail, vous pouvez configurer des alertes et recevoir des notifications lorsque la maintenance de vos instances ou de vos blocs réservés est planifiée, démarre ou est terminée. Vous pouvez également afficher et, si nécessaire, démarrer manuellement la maintenance sur une instance ou un bloc réservé avant l'heure prévue. Ces options vous aident à contrôler de manière proactive et à minimiser les temps d'arrêt de vos charges de travail.

Pour en savoir plus, consultez les ressources suivantes :

Outils de surveillance et de diagnostic du cluster

Pour la surveillance et le dépannage, les types de machines GPU en cluster incluent les services suivants pour la capacité liée à la réservation :

Étape suivante