Présentation des insights sur la fiabilité de Compute

Compute Reliability Insights propose un ensemble de fonctionnalités pour améliorer la fiabilité de vos charges de travail Compute Engine. Cet outil offre une visibilité sur les risques potentiels, ce qui permet une gestion efficace des risques grâce à des solutions détaillées et des recommandations proactives.

Cette page fournit des informations conceptuelles sur Compute Reliability Insights. Pour en savoir plus sur l'affichage et l'application des recommandations de fiabilité, consultez Afficher et appliquer des recommandations de fiabilité.

Comprendre les risques de fiabilité

Un risque de fiabilité est une situation dans laquelle une mauvaise configuration des fonctionnalités ou des paramètres de Compute Engine peut avoir un impact négatif sur la stabilité et la disponibilité de votre infrastructure. Cela peut se produire de différentes manières :

  • Défaillances en cascade inattendues : une panne dans une zone ou une région de l'infrastructure de Google peut perturber de manière inattendue vos ressources dans d'autres zones ou régions.
  • Dépendances externes : vos ressources peuvent dépendre de la disponibilité de régions Compute Engine spécifiques situées en dehors de votre emplacement de ressources principal.

Types de risques

Compute Reliability Insights identifie un sous-ensemble de risques potentiels dans vos charges de travail :

  • DNS global , qui est un risque qui se produit lorsque la configuration DNS interne de vos projets Compute Engine est définie sur Global DNS.

Gravité et priorité des risques

Compute Reliability Insights hiérarchise vos risques en utilisant les définitions de gravité et de priorité suivantes.

Gravité Priorité Description
Élevée P1 Une mauvaise configuration ou un paramètre qui, en cas de panne régionale, perturbe les services fréquemment utilisés dans plusieurs régions (par exemple, la création de VM).
Moyenne P2 Une mauvaise configuration ou un paramètre qui, en cas de panne régionale, perturbe les services moins critiques dans plusieurs régions (par exemple, la création de modèles d'instance).

Télémétrie et latence

Compute Reliability Insights s'appuie sur des données de télémétrie pour identifier les risques. Tenez compte du comportement suivant lorsque vous utilisez cette fonctionnalité :

  • Nouveaux projets et ressources inactives : pour les projets créés au cours des sept derniers jours ou les projets avec des VM inactives, les recommandations peuvent ne pas être disponibles car le pipeline nécessite davantage de données de télémétrie.
  • Délai d'atténuation : une fois que vous avez atténué un risque, la Google Cloud console et l' API peuvent continuer à afficher la recommandation pendant 24 heures maximum. En effet, le pipeline d'ingestion s'exécute toutes les 24 heures pour effacer les recommandations résolues.

Étape suivante