Resolver problemas do GKE

Este documento lista os documentos de solução de problemas comuns que você pode encontrar ao usar o Google Kubernetes Engine (GKE). Se você estiver diagnosticando erros de carga de trabalho, como ImagePullBackOff e CrashLoopBackOff, depurando o comportamento de escalonamento automático do cluster, resolvendo problemas de PersistentVolume ou solucionando problemas de registro de nós, os documentos listados aqui podem ajudar.

Se você não conhece a solução de problemas no GKE, comece com a Introdução à solução de problemas.

Para diagnosticar e resolver problemas encontrados, consulte os documentos nas seções a seguir:

Para resolver problemas de rede do GKE, consulte Resolver problemas de rede do GKE na documentação de rede do GKE.

Este documento é destinado a administradores e arquitetos, especialistas em segurança, especialistas em rede ou especialistas em armazenamento que resolvem problemas de configurações do GKE. Para saber mais sobre as funções do GKE, consulte Funções e tarefas comuns do usuário do GKE.

Introdução à solução de problemas

Tópico Descrição
Introdução à solução de problemas do GKE Comece a resolver problemas do GKE aprendendo sobre o processo geral e os conceitos fundamentais.
Analisar a integridade e os incidentes do serviço Saiba como verificar a integridade do GKE e dos serviços relacionados Google Cloud para excluir problemas de plataforma.
Avaliar a integridade do cluster e da carga de trabalho no Google Cloud console Saiba como usar o Google Cloud console para investigar e resolver problemas do GKE.
Investigar o estado de um cluster com kubectl Conheça os comandos e técnicas comuns de kubectl para diagnosticar problemas nos clusters e cargas de trabalho.
Realizar análises históricas com o Cloud Logging Entenda como usar o Cloud Logging de maneira eficaz para encontrar as causas raiz de problemas no GKE.
Realizar o monitoramento proativo com o Cloud Monitoring Use os painéis e as métricas do Cloud Monitoring para identificar, diagnosticar e resolver problemas do GKE.
Acelerar o diagnóstico com o Gemini Cloud Assist Descubra como o Gemini pode ajudar a diagnosticar e resolver problemas do GKE.
Como fazer tudo funcionar em conjunto: exemplo de cenário de solução de problemas Siga um exemplo detalhado de como resolver problemas em um cenário comum no GKE.

Configuração do cluster

Tópico Descrição
Criação de clusters Resolver problemas com a criação de clusters.
Clusters do Autopilot Diagnosticar e resolver problemas de clusters do Autopilot do GKE, incluindo criação de clusters, exclusão de namespace, escalonamento e problemas de carga de trabalho.
Ferramenta de linha de comando kubectl Resolver problemas da ferramenta de linha de comando kubectl no GKE, incluindo problemas de autenticação e autorização. Esta página também inclui orientações sobre como resolver problemas do proxy de conectividade para verificar se ele está fazendo com que os comandos kubectl logs, attach, exec, ou port-forward parem de responder.
Pools de nós padrão Resolver problemas em pools de nós do GKE Standard, incluindo problemas com a criação de pool de nós, provisionamento de melhor esforço, metadados de instâncias corrompidos e migração de cargas de trabalho para novos pools de nós.
Status NotReady do nó Saiba como diagnosticar e resolver o status NotReady do nó no GKE, resolvendo causas comuns, como escassez de recursos, problemas de rede e falhas de componentes.
Registro de nós Resolver problemas que ocorrem ao adicionar nós ao seu cluster GKE Standard, como falhas de registro de nós e pré-requisitos ausentes para o registro bem-sucedido de nós.
Ambiente de execução do contêiner Resolver problemas de ambientes de execução de contêineres no GKE, incluindo problemas com containerd e dockershim, e registros particulares.
Pools de nós do Windows Server Resolver problemas com pools de nós do Windows Server no GKE, incluindo falhas de inicialização de pods, erros de extração de imagem, problemas de conectividade de rede e problemas de status de nós.

Escalonamento automático

Tópico Descrição
O escalonador automático de clusters não está reduzindo a escala vertical Diagnosticar e resolver motivos comuns para o cluster não remover nós subutilizados. Saiba como verificar problemas como restritivos PodDisruptionBudgets, pods com armazenamento local ou anotações específicas (por exemplo, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") que impedem a remoção de nós.
O escalonador automático de clusters não está aumentando a escala vertical Saiba por que o escalonador automático de clusters não está adicionando novos nós para atender à demanda. Verifique se há pods não programáveis, se você não atingiu os limites de tamanho do cluster ou do pool de nós e identifique possíveis problemas de cota de recursos ou disponibilidade de VMs regionais.
Escalonamento automático horizontal de pods Resolver problemas com o Escalonador automático horizontal de pods que não está escalonando as réplicas de pods do aplicativo. Resolver problemas comuns, como objetos HorizontalPodAutoscaler mal configurados ou problemas com o pipeline de métricas

Armazenamento

Tópico Descrição
Armazenamento Resolver problemas de armazenamento, incluindo problemas com discos permanentes regionais, desempenho do disco e expansão de volume.

Segurança do cluster

Tópico Descrição
Authentication Resolver problemas de autenticação no GKE, incluindo problemas com RBAC, Federação de Identidade da Carga de Trabalho para GKE e o servidor de metadados do GKE.
Contas de serviço Resolver problemas de contas de serviço, incluindo a restauração da conta de serviço padrão e a ativação da conta de serviço padrão do Compute Engine.
Secrets da camada de aplicativos Resolver problemas que podem ocorrer ao configurar a criptografia de secrets da camada de aplicativos, incluindo atualizações com falha e erros em que não é possível usar uma chave do Cloud KMS ou em que a versão da chave do Cloud KMS foi destruída.

A autoridade certificadora raiz do cluster expira em breve

Tópico Descrição
Autoridade certificadora raiz (CA) expirando Se a autoridade certificadora raiz (CA) do cluster expirar em breve, saiba como realizar uma rotação de credenciais para evitar que as operações normais do cluster sejam interrompidas.

Cargas de trabalho

Tópico Descrição
Cargas de trabalho implantadas Resolver problemas de erros em cargas de trabalho executadas em um cluster do GKE incluindo PodUnschedulable. Leia a seção PodUnschedulable para receber orientações sobre erros como MatchNodeSelector e Does not have minimum availability.
Extrações de imagem Resolver problemas de extrações de imagem. Saiba o que causa status como ImagePullBackOff e ErrImagePull e como resolver esses status corrigindo problemas comuns, como autenticação e conectividade de rede.
Eventos CrashLoopBackOff Resolver problemas de eventos CrashLoopBackOff no GKE. Diagnosticar problemas como esgotamento de recursos, configurações incorretas de apps e falhas de verificação de atividade.
Eventos OOM Resolver problemas de eventos de falta de memória (OOM) do Kubernetes. Identificar causas, distinguir tipos de eventos e aplicar soluções eficazes para eliminações de OOM no contêiner e no nó.
Cargas de trabalho do Arm Resolver problemas com cargas de trabalho do Arm, incluindo pods em nós do Arm que falham.
TPUs Resolver problemas de TPUs, incluindo problemas com cota, provisionamento automático de nós , configuração de carga de trabalho e programação.
GPUs Resolver problemas de GPUs, incluindo problemas com instalação de drivers de GPU, erros de plug-in de dispositivo e imagens de contêiner.

Gerenciamento de clusters

Tópico Descrição
Upgrades de cluster Resolver problemas de upgrade de cluster e de nó do GKE incluindo upgrades longos ou incompletos, upgrades automáticos inesperados falhas e problemas pós-upgrade.
Webhooks Entenda como resolver problemas e garantir a estabilidade do seu plano de controle do cluster ao usar webhooks de admissão.
Namespace travado no estado Terminating Resolver problemas com namespaces travados no estadoTerminating identificando e removendo os componentes não íntegros que estão impedindo a exclusão.
Operações simultâneas Resolver problemas de operações simultâneas aprendendo a identificar esses erros e resolvê-los aguardando a conclusão das operações.

Monitoramento

Tópico Descrição
Métricas do sistema Resolver problemas de métricas do sistema que não aparecem no Cloud Monitoring.
Painéis de monitoramento Resolver problemas de painéis de monitoramento, incluindo problemas com a ativação do monitoramento, recursos do Kubernetes ausentes e permissões.
Resolver problemas de registros ausentes Resolver problemas de registros do GKE ausentes. Saiba como verificar o status da API , as configurações do cluster, as permissões, as cotas, os filtros e o comportamento do aplicativo.

Erros 4XX

Tópico Descrição
Erros 4XX Resolver alguns dos erros 400, 401, 403 e 404 que você pode encontrar ao usar o GKE. Esta página também inclui informações sobre como resolver problemas de permissões de edição ausentes em erros de conta.

Problemas conhecidos

Tópico Descrição
Problemas conhecidos Identificar e resolver problemas conhecidos que podem afetar o uso do GKE.

A seguir