Descripción general de las estadísticas de confiabilidad de Compute

Compute Reliability Insights ofrece un conjunto de funciones para mejorar la confiabilidad de tus cargas de trabajo de Compute Engine. Esta herramienta proporciona visibilidad de los riesgos potenciales, lo que permite una administración de riesgos eficaz a través de soluciones detalladas y recomendaciones proactivas.

En esta página, se proporciona información conceptual sobre Compute Reliability Insights. Para obtener más información sobre cómo ver y aplicar recomendaciones de confiabilidad, consulta Visualiza y aplica las recomendaciones de confiabilidad.

Comprende los riesgos de confiabilidad

Un riesgo de confiabilidad es una situación en la que la configuración incorrecta de las funciones o la configuración de Compute Engine podría afectar de forma negativa la estabilidad y la disponibilidad de tu infraestructura. Esto puede ocurrir de las siguientes maneras:

  • Fallas en cascada inesperadas: Una interrupción en una zona o región de la infraestructura de Google podría interrumpir de forma inesperada tus recursos en otras zonas o regiones.
  • Dependencias externas: Es posible que tus recursos dependan de la disponibilidad de regiones específicas de Compute Engine ubicadas fuera de la ubicación de tu recurso principal.

Tipos de riesgo

Compute Reliability Insights identifica un subconjunto de riesgos potenciales en tus cargas de trabajo:

Gravedad y prioridad del riesgo

Compute Reliability Insights prioriza tus riesgos con las siguientes definiciones de gravedad y prioridad.

Gravedad Prioridad Descripción
Alta P1 Una configuración incorrecta o un parámetro de configuración que, cuando se produce una interrupción regional, interrumpe los servicios de uso frecuente en varias regiones (por ejemplo, la creación de VM).
Medio P2 Una configuración incorrecta o un parámetro de configuración que, cuando se produce una interrupción regional, interrumpe los servicios menos críticos en varias regiones (por ejemplo, la creación de plantillas de instancias).

Telemetría y latencia

Compute Reliability Insights se basa en datos de telemetría para identificar riesgos. Ten en cuenta el siguiente comportamiento cuando uses esta función:

  • Proyectos nuevos y recursos inactivos: Es posible que las recomendaciones no estén disponibles para los proyectos creados en los últimos 7 días o los proyectos con VMs inactivas ya que la canalización requiere más datos de telemetría.
  • Retraso en la mitigación: Después de mitigar un riesgo, es posible que la Google Cloud consola y la API sigan mostrando la recomendación hasta por 24 horas. Esto se debe a que la canalización de ingreso se ejecuta cada 24 horas para borrar las recomendaciones resueltas.

¿Qué sigue?