Concevoir et optimiser des clusters GKE avec Compute Advisor

Ce document explique comment planifier et concevoir votre cluster en interrogeant Compute Advisor, une interface basée sur l'IA et optimisée par Gemini. Pour en savoir plus sur les composants que vous devez configurer avant ou lorsque vous créez un cluster GKE, consultez la présentation de GKE.

Compute Advisor vous aide à évaluer les options matérielles, à estimer les coûts de déploiement et à afficher les configurations recommandées pour vos clusters. Pour personnaliser ses recommandations, Compute Advisor évalue votre Google Cloud projet en vérifiant vos limites de quotas, vos réservations existantes, remises sur engagement d'utilisation, région et zone par défaut, ainsi que toutes les contraintes de localisation des ressources. En utilisant Compute Advisor pour vous aider à planifier, vous pouvez obtenir une configuration optimale pour votre charge de travail avant de créer ou de modifier un cluster GKE.

Limites

Lorsque vous interrogez Compute Advisor dans la Google Cloud console, vous ne pouvez pas créer, modifier ni supprimer directement des ressources.

Avant de commencer

Lorsque vous utilisez la Google Cloud console pour accéder aux Google Cloud services et aux API, vous n'avez pas besoin de configurer l'authentification.

Rôles requis

Pour obtenir les autorisations nécessaires pour accéder à Gemini et l'interroger, demandez à votre administrateur de vous attribuer le rôle IAM de lecteur de cluster Kubernetes Engine (roles/container.clusterViewer) sur le projet. Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.

Ce rôle prédéfini contient les autorisations requises pour accéder à Gemini et l'interroger. Pour connaître les autorisations exactes requises, développez la section Autorisations requises :

Autorisations requises

Vous devez disposer des autorisations suivantes pour accéder à Gemini et l'interroger :

  • Pour afficher la liste des clusters : container.clusters.list

Vous pouvez également obtenir ces autorisations avec des rôles personnalisés ou d'autres rôles prédéfinis.

Accéder à Compute Advisor dans la Google Cloud console

Pour accéder à Compute Advisor dans la Google Cloud console, procédez comme suit :

  1. Dans la Google Cloud console, accédez à la page Présentation.

    Accéder à la page "Présentation"

  2. Dans la section Concevez votre infrastructure avec Compute Advisor, vous pouvez afficher les éléments suivants :

    Éléments d'interface de la page Compute Advisor.

    Les éléments d'interface utilisateur affichés dans la capture d'écran précédente sont les suivants :

    • Fiches de requêtes à action rapide : ensemble de fiches contenant chacune un exemple de requête. Si vous cliquez sur une fiche, la Google Cloud console remplit automatiquement le champ du prompt avec l'exemple de prompt.

    • Champ du prompt : ce champ vous permet de saisir et d'envoyer des prompts. Pour envoyer une requête, cliquez sur Envoyer la requête.

    • Afficher les conversations précédentes : cette fonctionnalité vous permet d'afficher les détails d'une conversation passée et de la reprendre, ou de supprimer des conversations si vous n'en avez plus besoin.

    • Panneau latéral de l'historique des conversations : affiche vos discussions récentes. Ce panneau n'est visible qu'après avoir commencé à interroger la page Présentation. Vous pouvez interagir avec ce panneau comme suit :

      • Pour démarrer une nouvelle conversation, cliquez sur Nouvelle discussion.

      • Pour reprendre une conversation récente, cliquez sur la conversation dans la section Discussions récentes.

      • Pour afficher la liste de toutes vos conversations, cliquez sur Tout afficher. Sur la page Mon historique, vous pouvez afficher les détails d'une conversation passée et la reprendre, ou supprimer des conversations si vous n'en avez plus besoin.

Interroger Compute Advisor

Une fois que vous avez envoyé une requête, Compute Advisor commence à générer une réponse. Un volet s'affiche et Google Cloud la console affiche la réponse à votre requête dans le volet, comme illustré dans la capture d'écran suivante :

Réponse de recommandation générée dans le volet Compute Advisor.

En fonction de votre requête, le volet de réponse inclut les éléments suivants :

  • Ancrage contextuel : Compute Advisor évalue automatiquement le contexte de votre projet pour fournir des recommandations hautement personnalisées, y compris les limites de quotas, les réservations existantes, les remises sur engagement d'utilisation, votre région et votre zone par défaut, ainsi que toutes les contraintes de localisation des ressources.

  • Extraits de code interactifs : Compute Advisor génère des commandes gcloud, des méthodes d'API REST ou des ressources Terraform. Vous pouvez copier et coller ces extraits de code ou les exécuter dans Cloud Shell.

  • Canevas visuel : Compute Advisor organise les recommandations dans des tableaux structurés et des comparaisons côte à côte. Cette vue vous aide à évaluer les fonctionnalités des produits et les approches architecturales. Elle fournit également un plan d'implémentation pour votre cas d'utilisation.

Les sections suivantes décrivent les bonnes pratiques pour rédiger des requêtes, ainsi que des exemples de requêtes que vous pouvez utiliser avant de créer ou de modifier un cluster GKE.

Bonnes pratiques concernant les requêtes

Pour obtenir les recommandations les plus précises et les plus exploitables de Compute Advisor, nous vous recommandons de structurer vos requêtes de la même manière que vous le feriez pour un bloc de code. Cette approche guide l'IA générative en utilisant des déclarations de paramètres claires, des définitions de rôles, des instructions spécifiques et des formats de sortie explicites.

Lorsque vous interrogez Compute Advisor, tenez compte des bonnes pratiques suivantes :

  • Concentrez-vous sur la conception et la planification : nous vous recommandons de ne pas interroger Compute Advisor pour résoudre les erreurs de cluster GKE. Pour résoudre ces erreurs, consultez plutôt Résoudre les problèmes liés à GKE.

  • Spécifiez un persona ou un rôle : déclarez un rôle ou un persona cible, tel qu'un administrateur informatique, un chercheur en IA ou un ingénieur de plate-forme, que Compute Advisor doit adopter. Cette approche guide le ton, la profondeur et le niveau d'expertise des recommandations qui en résultent.

  • Fournissez des instructions explicites et numérotées : décomposez votre objectif en questions ou tâches concrètes et détaillées. Cette approche structure le processus de raisonnement de Compute Advisor et permet de s'assurer qu'il répond à toutes vos exigences.

  • Définissez un format de sortie spécifique : indiquez explicitement le format souhaité pour la recommandation, par exemple une explication détaillée, un tableau de comparaison Markdown ou un bloc de code gcloud prêt à l'emploi.

  • Tirez parti de l'ancrage contextuel automatique : vous n'avez pas besoin d'inclure votre région ou zone par défaut, les quotas disponibles, les remises sur engagement d'utilisation ni les contraintes de localisation des ressources dans votre requête. Compute Advisor peut accéder à ces informations dans votre Google Cloud projet.

  • Affinez vos conceptions de manière itérative : vous pouvez modifier ou développer la réponse générée par Compute Advisor en envoyant de nouvelles requêtes. Par exemple, vous pouvez demander à l'assistant d'ajouter des recommandations de mise en réseau à votre plan de déploiement ou de modifier les exigences de stockage sans démarrer une nouvelle conversation.

Exemples de requêtes

Voici des exemples de requêtes que vous pouvez utiliser pour vous aider à concevoir et à optimiser votre cluster GKE :

  • Topologie de cluster et configuration du pool de nœuds : pour déterminer le mode GKE, les types de machines et les configurations de pool de nœuds optimaux pour une charge de travail, utilisez une requête comme la suivante :

    Act as a cloud architect. I need to design a GKE cluster topology for a
    scalable microservices application that requires both GPU nodes for AI
    inference and CPU nodes for general-purpose APIs.
    
    Please provide the following:
    1. A comparison of running this workload on GKE Autopilot versus GKE Standard.
    2. Recommendations for GKE machine types for the GPU node pool.
    3. The optimal autoscaling and auto-provisioning settings.
    4. A YAML manifest that configures tolerations for GPU taints, which are required for AI workloads.
    
    Format the comparison as a Markdown table, and provide the cluster creation
    steps as a ready-to-use gcloud CLI command.
    
  • Modèle de provisionnement et optimisation des coûts : pour évaluer les modèles de provisionnement et optimiser l’utilisation des ressources pour les charges de travail de traitement par lot, utilisez une requête comme la suivante :

    Act as an IT administrator. I need to design a cost-optimized GKE cluster
    to run large-scale batch processing workloads that are fault-tolerant.
    
    Please provide the following:
    1. A cost and reliability comparison of using Spot VMs versus standard VMs
       in GKE node pools.
    2. An explanation of how to configure Kueue for queueing training jobs.
    3. A warning about the risk of latency for real-time inference when using Spot VMs.
    4. A YAML manifest to deploy the workloads onto Spot VM nodes.
    
    Format the comparison as a Markdown table, and provide the manifest as a
    ready-to-use code block.
    
  • Topologie de disque avec état : pour trouver une architecture de stockage persistant optimisée pour une base de données à haute disponibilité sur GKE, utilisez une requête comme la suivante :

    Act as a storage engineer. I need to design a StatefulSet topology in
    GKE for a distributed database that relies on Persistent Disks.
    
    Please provide the following:
    1. A comparison of regional Persistent Disks versus zonal Persistent Disks.
    2. An explanation of how the standard-rwo StorageClass prevents deadlocks in zonal Persistent Disks.
    3. A YAML manifest that shows how to deploy a stateful workload with the "volumeBindingMode: WaitForFirstConsumer" field.
    
    Format the response with Markdown headers, and provide the deployment
    manifest as a ready-to-use code block.
    
  • Requête de migration Karpenter : pour planifier une migration d'AWS Karpenter vers les fonctionnalités d'autoscaling de GKE, utilisez une requête comme la suivante :

    Act as a Kubernetes migration specialist. I am migrating an EKS cluster
    that uses Karpenter to GKE. Please translate my AWS Karpenter
    NodePool into a GKE custom ComputeClass.
    
    Please provide the following:
    1. A summary that maps Karpenter concepts to GKE Node Auto-Provisioning (NAP) and ComputeClasses.
    2. A YAML manifest that shows how a ComputeClass provides the same variety of instance types and weighting for  Spot VMs as Karpenter.
    3. The changes required in the Pod manifest to use the new ComputeClass.
    
    Format the mapping as a Markdown table, and provide the GKE
    manifests as code blocks that are ready to use.
    

Étape suivante