Résoudre les problèmes liés à GKE

Ce document répertorie les documents de dépannage pour les problèmes courants que vous pouvez rencontrer lors de l'utilisation de Google Kubernetes Engine (GKE). Que vous diagnostiquiez des erreurs de charge de travail telles que ImagePullBackOff et CrashLoopBackOff, que vous déboguiez le comportement d'autoscaling du cluster, que vous résolviez des problèmes liés à PersistentVolume ou que vous résolviez des problèmes d'enregistrement de nœuds, les documents listés ici peuvent vous aider.

Si vous débutez dans le dépannage dans GKE, commencez par Introduction au dépannage.

Pour diagnostiquer et résoudre les problèmes que vous rencontrez, consultez les documents des sections suivantes :

Pour résoudre les problèmes de mise en réseau GKE, consultez Résoudre les problèmes de mise en réseau GKE dans la documentation sur la mise en réseau GKE.

Ce document s'adresse aux administrateurs, aux architectes, aux spécialistes de la sécurité, aux spécialistes de la mise en réseau ou aux spécialistes du stockage qui résolvent les problèmes de configuration de GKE. Pour en savoir plus sur les rôles GKE, consultez Rôles utilisateur et tâches courantes de GKE.

Présentation du dépannage

Sujet Description
Présentation du dépannage de GKE Commencez à résoudre les problèmes liés à GKE en découvrant le processus global et les concepts fondamentaux.
Examiner Service Health et les incidents Découvrez comment vérifier l'état de GKE et des services Google Cloud associés pour exclure les problèmes de plate-forme.
Évaluer l'état du cluster et de la charge de travail dans la console Google Cloud Découvrez comment utiliser la console Google Cloud pour examiner et résoudre les problèmes liés à GKE.
Examiner l'état d'un cluster avec kubectl Découvrez les commandes et techniques kubectl courantes pour diagnostiquer les problèmes dans vos clusters et charges de travail.
Effectuer des analyses historiques avec Cloud Logging Comprendre comment utiliser efficacement Cloud Logging pour identifier les causes d'un problème dans GKE
Surveiller de manière proactive avec Cloud Monitoring Utilisez les tableaux de bord et les métriques Cloud Monitoring pour identifier, diagnostiquer et résoudre les problèmes GKE.
Accélérer le diagnostic avec Gemini Cloud Assist Découvrez comment Gemini peut vous aider à diagnostiquer et à résoudre les problèmes liés à GKE.
Synthèse : exemple de scénario de dépannage Suivez un exemple pas à pas de dépannage d'un scénario courant dans GKE.

Configurer le cluster

Sujet Description
Création du cluster Résolvez les problèmes de création de clusters.
Clusters Autopilot Diagnostiquer et résoudre les problèmes liés aux clusters GKE Autopilot, y compris la création de clusters, la suppression d'espaces de noms, le scaling et les problèmes de charge de travail.
Outil de ligne de commande Kubectl Résolvez les problèmes liés à l'outil de ligne de commande kubectl dans GKE, y compris les problèmes d'authentification et d'autorisation. Cette page inclut également des conseils sur la façon de résoudre les problèmes liés au proxy Konnectivity pour vérifier s'il est à l'origine de l'arrêt des commandes kubectl logs, attach, exec ou port-forward.
Pools de nœuds standards Résoudre les problèmes liés aux pools de nœuds GKE Standard, y compris les problèmes de création de pools de nœuds, de provisionnement au mieux, de métadonnées d'instance corrompues et de migration des charges de travail vers de nouveaux pools de nœuds.
État du nœud NotReady Découvrez comment diagnostiquer et résoudre l'état NotReady des nœuds dans GKE en résolvant les causes courantes telles que les pénuries de ressources, les problèmes de réseau et les défaillances de composants.
Enregistrement des nœuds Résolvez les problèmes qui surviennent lors de l'ajout de nœuds à votre cluster GKE Standard, tels que les échecs d'enregistrement des nœuds et les conditions préalables manquantes pour l'enregistrement réussi des nœuds.
Environnement d'exécution du conteneur Résolvez les problèmes liés aux environnements d'exécution de conteneurs dans GKE, y compris les problèmes liés à containerd et dockershim, ainsi qu'aux registres privés.
Pools de nœuds Windows Server Résolvez les problèmes liés aux pools de nœuds Windows Server dans GKE, y compris les échecs de démarrage de pods, les erreurs d'extraction d'images, les problèmes de connectivité réseau et les problèmes d'état des nœuds.

Autoscaling

Sujet Description
L'autoscaler de cluster n'effectue pas de scaling à la baisse Diagnostiquer et résoudre les problèmes courants qui empêchent votre cluster de supprimer les nœuds sous-utilisés. Découvrez comment vérifier s'il existe des problèmes tels que des PodDisruptionBudgets restrictifs, des pods avec stockage local ou des annotations spécifiques (par exemple, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") qui empêchent l'éviction des nœuds.
L'autoscaler de cluster n'effectue pas de scaling à la hausse Découvrez pourquoi l'autoscaler de cluster n'ajoute pas de nœuds pour répondre à la demande. Vérifiez s'il existe des pods non planifiables, assurez-vous de ne pas avoir atteint les limites de taille du cluster ou du pool de nœuds, et identifiez les éventuels problèmes de quota de ressources ou de disponibilité des VM régionales.
Autoscaling horizontal des pods Résolvez les problèmes liés à l'autoscaler horizontal de pods qui ne met pas à l'échelle les répliques de pods de votre application. Résolvez les problèmes courants, tels que les ressources HorizontalPodAutoscaler mal configurées ou les problèmes liés au pipeline de métriques.
Autoscaling vertical des pods Résolvez les problèmes liés à l'autoscaler vertical des pods qui ne met pas à l'échelle les ressources de pod de votre application. Résolvez les problèmes courants, tels que les ressources VerticalPodAutoscaler mal configurées ou les problèmes liés au pipeline de métriques.

Stockage

Sujet Description
Stockage Résolvez les problèmes de stockage, y compris ceux liés aux disques persistants régionaux, aux performances des disques et à l'expansion des volumes.

Sécurité du cluster

Sujet Description
Authentification Résolvez les problèmes d'authentification dans GKE, y compris ceux liés au RBAC, à Workload Identity Federation for GKE et au serveur de métadonnées GKE.
Comptes de service Résolvez les problèmes liés aux comptes de service, y compris la restauration du compte de service par défaut et l'activation du compte de service Compute Engine par défaut.
Secrets au niveau de la couche d'application Résolvez les problèmes qui peuvent survenir lors de la configuration du chiffrement des secrets au niveau de l'application, y compris les échecs de mise à jour et les erreurs lorsque vous ne pouvez pas utiliser de clé Cloud KMS ou lorsque la version de clé Cloud KMS a été détruite.

L'autorité de certification racine du cluster arrive bientôt à expiration

Sujet Description
Expiration de l'autorité de certification (CA) racine Si l'autorité de certification racine de votre cluster arrive bientôt à expiration, découvrez comment effectuer une rotation des identifiants pour éviter toute interruption des opérations normales sur les clusters.

Charges de travail

Sujet Description
Charges de travail déployées Résolvez les problèmes liés aux charges de travail exécutées dans un cluster GKE, y compris PodUnschedulable. Consultez la section "PodUnschedulable" pour obtenir des conseils sur les erreurs telles que MatchNodeSelector et Does not have minimum availability.
Récupération d'images Résolvez les problèmes d'extraction d'images. Découvrez les causes des états ImagePullBackOff et ErrImagePull, et comment les résoudre en corrigeant les problèmes courants tels que l'authentification et la connectivité réseau.
Événements CrashLoopBackOff Résolvez les problèmes liés aux événements CrashLoopBackOff dans GKE. Diagnostiquez les problèmes tels que l'épuisement des ressources, les erreurs de configuration des applications et les échecs des vérifications d'activité.
Événements OOM Résolvez les problèmes liés aux événements Kubernetes de mémoire insuffisante (OOM). Identifier les causes, distinguer les types d'événements et appliquer des solutions efficaces pour les arrêts OOM au niveau du conteneur et du nœud.
Charges de travail Arm Résolvez les problèmes liés aux charges de travail Arm, y compris le plantage des pods sur les nœuds Arm.
TPU Résolvez les problèmes liés aux TPU, y compris ceux liés au quota, au provisionnement automatique des nœuds, à la configuration des charges de travail et à la planification.
GPU Résolvez les problèmes liés aux GPU, y compris ceux liés à l'installation des pilotes de GPU, aux erreurs de plug-in d'appareil et aux images de conteneur.

Gestion des clusters

Sujet Description
Mises à niveau de cluster Résolvez les problèmes de mise à niveau des clusters et des nœuds GKE, y compris les mises à niveau longues ou incomplètes, les mises à niveau automatiques inattendues, les échecs et les problèmes post-mise à niveau.
Webhook Découvrez comment résoudre les problèmes et assurer la stabilité du plan de contrôle de votre cluster lorsque vous utilisez des webhooks d'admission.
Espace de noms bloqué à l'état Terminating Résolvez les problèmes liés aux espaces de noms bloqués à l'état Terminating en identifiant et en supprimant les composants non opérationnels qui bloquent la suppression.
Opérations simultanées Résolvez les problèmes liés aux opérations simultanées en apprenant à identifier ces erreurs et à les résoudre en attendant que les opérations se terminent.

Surveillance

Sujet Description
Métriques système Résolvez les problèmes liés aux métriques système qui n'apparaissent pas dans Cloud Monitoring.
Tableaux de bord Monitoring Résolvez les problèmes liés aux tableaux de bord de surveillance, y compris les problèmes d'activation de la surveillance, les ressources Kubernetes manquantes et les autorisations.
Résoudre les problèmes de journaux manquants Résolvez les problèmes de journaux GKE manquants. Découvrez comment vérifier l'état de l'API, les paramètres du cluster, les autorisations, les quotas, les filtres et le comportement de l'application.

Erreurs 4xx

Sujet Description
Erreurs 4xx Résolvez certains des problèmes 400, 401, 403 et 404 que vous pouvez rencontrer lorsque vous utilisez GKE. Cette page explique également comment résoudre les erreurs liées à l'absence d'autorisation de modification du compte.

Problèmes connus

Sujet Description
Problèmes connus Identifier et résoudre les problèmes connus qui peuvent affecter votre utilisation de GKE

Étapes suivantes