Gerenciar eventos de erro de serviço

No Error Reporting, é possível monitorar e diagnosticar falhas de plataforma em Google Cloud serviços que registram mensagens de erro sem stack traces, ajudando a resolver problemas de infraestrutura rapidamente.

Por exemplo, se o Cloud Run atingir o limite máximo de instâncias de contêiner durante uma solicitação, a falha será registrada em uma entrada de registro. O Error Reporting detecta esse evento, o agrupa com erros de serviço semelhantes e notifica você. Em seguida, é possível usar links diretos no console para abrir a documentação de solução de problemas específica do serviço e resolver o gargalo.

Conferir grupos de erros de serviço

No Google Cloud console, acesse a página Error Reporting:

Acessar o Error Reporting

Também é possível encontrar essa página usando a barra de pesquisa.

Quando o Error Reporting determina que há uma falha de serviço, ele agrupa esses eventos de erro e define o tipo de erro como Service error. A visão geral do Error Reporting mostra o tipo de erro e outras informações sobre o grupo de erros:

Página de visão geral do Error Reporting

Para eventos de erro de serviço com soluções documentadas, o Error Reporting fornece um link para o guia de solução de problemas do Google Cloud serviço.

Exemplos de eventos de erro de serviço

A tabela a seguir lista alguns, mas não todos, os eventos de erro que o recurso Erros de serviço no Error Reporting captura.

Google Cloud Nome do serviço Tipo de erro
Dataflow Limitação de registros de worker
Sem memória (sistema)
Sub-rede personalizada ausente
Operação longa na etapa
Falha no JRE
Arquivo JAR de worker configurado incorretamente
Cloud Run Limite de memória excedido
Nenhuma instância disponível
Google Kubernetes Engine Pod não íntegro, falha na sondagem
Falha ao programar pods
Como reiniciar o contêiner com falha com espera
Volume desconectado
Falha ao extrair imagem do contêiner
Falha ao atualizar o endpoint
Secrets/ConfigMaps não encontrados