Esta página fornece informações conceituais sobre o Compute Reliability Insights. Para mais informações sobre como visualizar e aplicar recomendações de confiabilidade, consulte Visualizar e aplicar recomendações de confiabilidade.
Entender os riscos de confiabilidade
Um risco de confiabilidade é uma situação em que a configuração incorreta dos recursos ou das configurações do Compute Engine pode afetar negativamente a estabilidade e a disponibilidade da sua infraestrutura. Isso pode ocorrer das seguintes maneiras:
- Falhas em cascata inesperadas: uma interrupção em uma zona ou região da infraestrutura do Google pode interromper inesperadamente seus recursos em outras zonas ou regiões.
- Dependências externas: seus recursos podem depender da disponibilidade de regiões específicas do Compute Engine localizadas fora do local principal do recurso.
Tipos de risco
O Compute Reliability Insights identifica um subconjunto de possíveis riscos nas suas cargas de trabalho:
- DNS global
, que é um risco que ocorre quando seus projetos do Compute Engine têm a
configuração de DNS interno
definida como
Global DNS.
Gravidade e prioridade do risco
O Compute Reliability Insights prioriza seus riscos usando as seguintes definições de gravidade e prioridade.
| Gravidade | Prioridade | Descrição |
|---|---|---|
| Alta | P1 | Uma configuração incorreta ou uma configuração que, quando ocorre uma interrupção regional, interrompe serviços usados com frequência em várias regiões (por exemplo, criação de VMs). |
| Média | P2 | Uma configuração incorreta ou uma configuração que, quando ocorre uma interrupção regional, interrompe serviços menos críticos em várias regiões (por exemplo, criação de modelos de instância). |
Telemetria e latência
O Compute Reliability Insights depende de dados de telemetria para identificar riscos. Considere o seguinte comportamento ao usar esse recurso:
- Projetos novos e recursos inativos: para projetos criados nos últimos 7 dias ou projetos com VMs inativas, as recomendações podem não estar disponíveis porque o pipeline exige mais dados de telemetria.
- Atraso na mitigação: depois de mitigar um risco, o Google Cloud console e a API podem continuar mostrando a recomendação por até 24 horas. Isso ocorre porque o pipeline de ingestão é executado a cada 24 horas para limpar as recomendações resolvidas.
A seguir
- Saiba como visualizar e aplicar recomendações de confiabilidade.