Visão geral dos insights de confiabilidade do Compute

O Compute Reliability Insights oferece um conjunto de recursos para melhorar a confiabilidade da carga de trabalho do Compute Engine. Essa ferramenta oferece visibilidade dos possíveis riscos, permitindo um gerenciamento eficaz deles por meio de soluções detalhadas e recomendações proativas.

Esta página fornece informações conceituais sobre o Compute Reliability Insights. Para mais informações sobre como visualizar e aplicar recomendações de confiabilidade, consulte Visualizar e aplicar recomendações de confiabilidade.

Entender os riscos de confiabilidade

Um risco de confiabilidade é uma situação em que a configuração incorreta dos recursos ou das configurações do Compute Engine pode afetar negativamente a estabilidade e a disponibilidade da sua infraestrutura. Isso pode ocorrer das seguintes maneiras:

  • Falhas em cascata inesperadas: uma interrupção em uma zona ou região da infraestrutura do Google pode interromper inesperadamente seus recursos em outras zonas ou regiões.
  • Dependências externas: seus recursos podem depender da disponibilidade de regiões específicas do Compute Engine localizadas fora do local principal do recurso.

Tipos de risco

O Compute Reliability Insights identifica um subconjunto de possíveis riscos nas suas cargas de trabalho:

Gravidade e prioridade do risco

O Compute Reliability Insights prioriza seus riscos usando as seguintes definições de gravidade e prioridade.

Gravidade Prioridade Descrição
Alta P1 Uma configuração incorreta ou uma configuração que, quando ocorre uma interrupção regional, interrompe serviços usados com frequência em várias regiões (por exemplo, criação de VMs).
Média P2 Uma configuração incorreta ou uma configuração que, quando ocorre uma interrupção regional, interrompe serviços menos críticos em várias regiões (por exemplo, criação de modelos de instância).

Telemetria e latência

O Compute Reliability Insights depende de dados de telemetria para identificar riscos. Considere o seguinte comportamento ao usar esse recurso:

  • Projetos novos e recursos inativos: para projetos criados nos últimos 7 dias ou projetos com VMs inativas, as recomendações podem não estar disponíveis porque o pipeline exige mais dados de telemetria.
  • Atraso na mitigação: depois de mitigar um risco, o Google Cloud console e a API podem continuar mostrando a recomendação por até 24 horas. Isso ocorre porque o pipeline de ingestão é executado a cada 24 horas para limpar as recomendações resolvidas.

A seguir