Risolvere i problemi di GKE

Questo documento elenca i documenti per la risoluzione dei problemi comuni che potresti riscontrare durante l'utilizzo di Google Kubernetes Engine (GKE). Che tu stia diagnosticando errori di workload come ImagePullBackOff e CrashLoopBackOff, eseguendo il debug del comportamento di scalabilità automatica del cluster, risolvendo problemi di PersistentVolume o risolvendo i problemi di registrazione dei nodi, i documenti elencati qui possono aiutarti.

Se non hai mai risolto i problemi in GKE, inizia con Introduzione alla risoluzione dei problemi.

Per diagnosticare e risolvere i problemi riscontrati, consulta i documenti nelle seguenti sezioni:

Per risolvere i problemi di rete GKE, consulta Risolvere i problemi di rete GKE nella documentazione di rete GKE.

Questo documento è destinato ad amministratori e architetti, specialisti della sicurezza, specialisti di Networking o specialisti di archiviazione che risolvono i problemi di configurazione di GKE. Per saperne di più sui ruoli GKE, consulta Ruoli e attività utente GKE comuni.

Introduzione alla risoluzione dei problemi

Argomento Descrizione
Introduzione alla risoluzione dei problemi di GKE Inizia a risolvere i problemi di GKE imparando il processo generale e i concetti fondamentali.
Controlla l'integrità e gli incidenti dei servizi Scopri come controllare l'integrità di GKE e dei servizi correlati Google Cloud per escludere problemi della piattaforma.
Valuta l'integrità del cluster e del workload nella Google Cloud console Scopri come utilizzare la Google Cloud console per esaminare e risolvere i problemi di GKE.
Esamina lo stato di un cluster con kubectl Esplora i comandi e le tecniche kubectl comuni per diagnosticare i problemi nei cluster e nei workload.
Esegui un'analisi storica con Cloud Logging Scopri come utilizzare Cloud Logging in modo efficace per trovare le cause principali di problemi in GKE.
Esegui il monitoraggio proattivo con Cloud Monitoring Utilizza le dashboard e le metriche di Cloud Monitoring per identificare, diagnosticare e risolvere i problemi di GKE.
Accelera la diagnosi con Gemini Cloud Assist Scopri come Gemini può aiutarti a diagnosticare e risolvere i problemi di GKE.
Metti tutto insieme: scenario di risoluzione dei problemi di esempio Segui un esempio passo passo di risoluzione dei problemi di uno scenario comune in GKE.

Configurazione del cluster

Argomento Descrizione
Creazione del cluster Risolvi i problemi relativi alla creazione dei cluster.
Cluster Autopilot Diagnostica e risolvi i problemi dei cluster GKE Autopilot, inclusi la creazione di cluster, l'eliminazione di spazi dei nomi, la scalabilità e i problemi dei workload.
Strumento a riga di comando Kubectl Risolvi i problemi dello strumento a riga di comando kubectl in GKE, inclusi i problemi di autenticazione e autorizzazione. Questa pagina include anche consigli su come risolvere i problemi del proxy Konnectivity per verificare se causa l'interruzione della risposta dei comandi kubectl logs, attach, exec, o port-forward.
Node pool standard Risolvi i problemi dei node pool GKE Standard, inclusi i problemi relativi alla creazione di pool di nodi, al provisioning best-effort, ai metadati delle istanze danneggiati e alla migrazione dei workload a nuovi node pool.
Stato NotReady del nodo Scopri come diagnosticare e risolvere lo stato NotReady del nodo in GKE risolvendo le cause comuni, come carenze di risorse, problemi di rete ed errori dei componenti.
Registrazione dei nodi Risolvi i problemi che si verificano quando aggiungi nodi al tuo cluster GKE Standard, come errori di registrazione dei nodi e prerequisiti mancanti per la registrazione dei nodi.
Runtime container Risolvi i problemi dei runtime container in GKE, inclusi i problemi relativi a containerd e dockershim, nonché ai registri privati.
Node pool Windows Server Risolvi i problemi relativi ai node pool Windows Server in GKE, inclusi errori di avvio dei pod, errori di pull delle immagini, problemi di connettività di rete e problemi di stato dei nodi.

Scalabilità automatica

Argomento Descrizione
Il gestore della scalabilità automatica del cluster non esegue lo scale down Diagnostica e risolvi i motivi comuni per cui il cluster non rimuove i nodi sottoutilizzati. Scopri come verificare la presenza di problemi come restrittivi PodDisruptionBudgets, pod con spazio di archiviazione locale o annotazioni specifiche (ad esempio, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") che impediscono l'espulsione dei nodi.
Il gestore della scalabilità automatica del cluster non esegue lo scale up Scopri perché il gestore della scalabilità automatica del cluster non aggiunge nuovi nodi per soddisfare la domanda. Verifica la presenza di pod non pianificabili, assicurati di non aver raggiunto i limiti di dimensioni del cluster o del node pool e identifica potenziali problemi di quota di risorse o di disponibilità delle VM availability issues.
Scalabilità automatica orizzontale dei pod Risolvi i problemi relativi al Horizontal Pod Autoscaler che non scala le repliche dei pod dell'applicazione. Risolvi i problemi comuni, come risorse HorizontalPodAutoscaler configurate in modo errato o problemi con la pipeline delle metriche
Scalabilità automatica verticale dei pod Risolvi i problemi relativi al gestore della scalabilità automatica pod verticale che non scala le risorse dei pod dell'applicazione. Risolvi i problemi comuni, come risorse VerticalPodAutoscaler configurate in modo errato o problemi con la pipeline delle metriche.

Spazio di archiviazione

Argomento Descrizione
Spazio di archiviazione Risolvi i problemi di archiviazione, inclusi i problemi relativi ai dischi permanenti regionali, prestazioni dei dischi e all'espansione dei volumi.

Sicurezza del cluster

Argomento Descrizione
Autenticazione Risolvi i problemi di autenticazione in GKE, inclusi i problemi relativi a RBAC, Workload Identity Federation for GKE e al server di metadati GKE.
Service account Risolvi i problemi relativi ai service account, inclusi il ripristino del service account predefinito e l'abilitazione del account di servizio predefinito di Compute Engine.
Secret a livello di applicazione Risolvi i problemi che possono verificarsi durante la configurazione della crittografia dei secret a livello di applicazione, inclusi aggiornamenti non riusciti ed errori in cui non puoi utilizzare una chiave Cloud KMS o in cui la versione della chiave Cloud KMS è stata eliminata.

L'autorità di certificazione radice del cluster scadrà a breve

Argomento Descrizione
L'autorità di certificazione radice (CA) scadrà Se l'autorità di certificazione (CA) radice del cluster scadrà a breve, scopri come eseguire una rotazione delle credenziali per evitare l'interruzione delle normali operazioni del cluster.

Workload

Argomento Descrizione
Workload di cui è stato eseguito il deployment Risolvi gli errori relativi ai workload in esecuzione in un cluster GKE incluso PodUnschedulable. Leggi la sezione PodUnschedulable per ricevere consigli su errori come MatchNodeSelector e Does not have minimum availability.
Pull delle immagini Risolvi i problemi relativi al pull delle immagini. Scopri le cause di stati come ImagePullBackOff e ErrImagePull e come risolverli correggendo problemi comuni come l'autenticazione e la connettività di rete.
Eventi CrashLoopBackOff Risolvi i problemi relativi agli0/eventi in101GKE.CrashLoopBackOff Diagnostica problemi come l'esaurimento delle risorse, le configurazioni errate delle app e gli errori del probe di attività.
Eventi OOM Risolvi i problemi relativi agli eventi Out Of Memory (OOM) di Kubernetes. Identifica le cause, distingui i tipi di eventi e applica soluzioni efficaci per gli OOM kill a livello di container e di nodo.
Workload Arm Risolvi i problemi relativi ai workload Arm, inclusi i pod sui nodi Arm che si arrestano in modo anomalo.
TPU Risolvi i problemi relativi alle TPU, inclusi i problemi relativi a quota, provisioning automatico dei nodi , configurazione dei workload e pianificazione.
GPU Risolvi i problemi relativi alle GPU, inclusi i problemi relativi all'installazione dei driver GPU, errori dei plug-in dei dispositivi e immagini container.

Gestione dei cluster

Argomento Descrizione
Upgrade dei cluster Risolvi i problemi relativi all'upgrade dei cluster e dei nodi GKE inclusi upgrade lunghi o incompleti, upgrade automatici imprevisti errori e problemi post-upgrade.
Webhook Scopri come risolvere i problemi e garantire la stabilità del control plane del cluster quando utilizzi i webhook di ammissione.
Lo spazio dei nomi è bloccato nello stato Terminating Risolvi i problemi relativi agli spazi dei nomi bloccati nello Terminating stato identificando e rimuovendo i componenti non integri che bloccano l'eliminazione.
Operazioni simultanee Risolvi i problemi relativi alle operazioni simultanee imparando a identificare questi errori e a risolverli attendendo il completamento delle operazioni.

Monitoraggio

Argomento Descrizione
Metriche di sistema Risolvi i problemi relativi alle metriche di sistema che non vengono visualizzate in Cloud Monitoring.
Dashboard di monitoraggio Risolvi i problemi relativi alle dashboard di monitoraggio, inclusi i problemi relativi all'abilitazione monitoraggio, alle risorse Kubernetes mancanti e alle autorizzazioni.
Risolvi i problemi relativi ai log mancanti Risolvi i problemi relativi ai log GKE mancanti. Scopri come controllare lo stato dell'API lo stato, le impostazioni del cluster, le autorizzazioni, le quote, i filtri e il comportamento dell'applicazione il comportamento.

Errori 4xx

Argomento Descrizione
Errori 4xx Risolvi alcuni degli errori 400, 401, 403 e 404 che potresti riscontrare durante l'utilizzo di GKE. Questa pagina include anche informazioni su come risolvere i problemi relativi alle autorizzazioni di modifica mancanti negli errori dell'account.

Problemi noti

Argomento Descrizione
Problemi noti Identifica e risolvi i problemi noti che potrebbero influire sul tuo utilizzo di GKE.

Passaggi successivi