Obtén información para supervisar el estado, el tiempo de actividad y las actualizaciones de tus cargas de trabajo de Google Distributed Cloud conectado. Para obtener más información sobre cómo configurar la supervisión y sobre las métricas disponibles, consulta Registros y métricas.
Supervisa el estado y el tiempo de actividad de las cargas de trabajo
Eres responsable de supervisar el estado y el tiempo de actividad de tus cargas de trabajo (contenedores y máquinas virtuales) que se ejecutan en Distributed Cloud conectado.
Cargas de trabajo de contenedores
Para supervisar el estado y el tiempo de actividad de las cargas de trabajo en contenedores que implementas, te recomendamos que uses la solución de métricas de Prometheus. Puedes configurar Prometheus para recopilar métricas de tus pods y servicios. Google supervisa y administra automáticamente los servicios del sistema administrados por Google. Para obtener más información sobre cómo configurar Prometheus, consulta Recopila métricas con Prometheus.
Usa las siguientes métricas clave para supervisar las cargas de trabajo de contenedores. Si usas Prometheus, eres responsable de implementar y administrar Kube State Metrics para exponer estas métricas específicas para tus cargas de trabajo:
kube_pod_status_phase: Supervisa los pods en las fasesFailedoUnknown.kube_pod_container_status_waiting_reason: Identifica los pods atascados enCrashLoopBackOffoImagePullBackOff.container_cpu_usage_seconds_totalycontainer_memory_working_set_bytes(de cAdvisor): Supervisa el consumo de recursos para evitar problemas de memoria insuficiente (OOM).
Cargas de trabajo de máquinas virtuales
En Distributed Cloud conectado, las máquinas virtuales (VMs) se ejecutan dentro de los pods de Kubernetes estándar, que suelen tener el prefijo virt-launcher-. Supervisa el estado y el estado de la VM principalmente verificando el estado del recurso personalizado VirtualMachine o supervisando las métricas de la aplicación desde la VM.
Usa las métricas subyacentes del pod virt-launcher como indicadores secundarios para los siguientes detalles:
- Uso de recursos: Supervisa el consumo de CPU y memoria de los pods de inicio para garantizar que las VMs tengan recursos suficientes.
- Fase del pod: Realiza un seguimiento de las fases del pod de inicio para identificar las VMs que no se inician o fallan.
Para ajustar los recursos asignados a una VM, modifica la especificación del recurso personalizado de la VM. No modifiques directamente los archivos YAML subyacentes del pod virt-launcher, ya que la plataforma los administra. Cualquier cambio directo se anulará o generará errores de conciliación.
Para solucionar problemas de VMs atascadas en un estado pendiente, consulta Soluciona problemas de máquinas virtuales atascadas en estado pendiente.
Supervisa las actualizaciones de Distributed Cloud conectado
Supervisa el progreso y el estado de las actualizaciones de software de Distributed Cloud conectado con las métricas de Cloud Monitoring y los comandos de gcloud.
Google programa y ejecuta las actualizaciones. La supervisión es estrictamente para la visibilidad y la planificación de la migración de cargas de trabajo.
Para obtener instrucciones detalladas sobre cómo verificar si una actualización está en curso, supervisar su estado y solucionar problemas de actualizaciones fallidas, consulta Soluciona problemas de actualizaciones de software.
Supervisión de varios clústeres
Si administras muchos clústeres de Distributed Cloud conectado, te recomendamos que uses Cloud Monitoring para agregar y filtrar métricas.
Usa etiquetas de recursos: Las métricas exportadas a Cloud Monitoring incluyen etiquetas que identifican la fuente. Las etiquetas disponibles dependen del tipo de recurso:
Para las métricas de clúster y contenedor, como
k8s_container, las etiquetas clave incluyen los siguientes valores:project_id: El Google Cloud proyecto que aloja el clúster.location: Laregión en la que se registra el clúster. Google Cloudcluster_name: Es el nombre del clúster.
Para las métricas de hardware, como
edgecontainer.googleapis.com/machine, las etiquetas clave incluyen los siguientes valores:resource_container: El Google Cloud proyecto asociado con el hardware.location: Laregión en la que se registra la zona de Distributed Cloud conectado. Google Cloudmachine_id: El identificador de la máquina.
Las métricas de hardware no incluyen una etiqueta
cluster_namedirectamente.
Crea paneles personalizados: Crea paneles que muestren indicadores clave de estado en toda tu flota. Los indicadores clave de estado incluyen la conectividad, el estado de la VM y el uso de recursos. Para mostrar datos de varios clústeres en un solo gráfico, usa comodines o operaciones de agrupación.
Configura alertas de varios clústeres: Configura políticas de alertas que se apliquen a varios clústeres. Por ejemplo, puedes crear una alerta que se active si alguna máquina de algún clúster pierde la conectividad.
Estrategia de alertas
La supervisión y el mantenimiento de Distributed Cloud conectado son una responsabilidad compartida. En esta sección, se explica sobre qué alerta Google y cómo puedes configurar tus propias políticas de alertas.
Sobre qué alerta Google
Google supervisa continuamente la infraestructura subyacente. Toma medidas y te notifica si es necesario en las siguientes situaciones:
- Fallas de hardware: Fallas en la fuente de alimentación, fallas en el ventilador, sobrecalentamiento, o fallas en el disco, como un disco que alcanza su umbral de repuesto o el final de su vida útil.
- Problemas de conectividad: Pérdida completa de la conexión entre la zona de Distributed Cloud conectado y Google Cloud.
- Estado del plano de control: Fallas en el plano de control de Kubernetes o en los servicios del sistema administrados por Google.
- Fallas de actualización: Procesos de actualización automáticos que se atascan o fallan.
Configura alertas
Configura tus propias políticas de alertas en Cloud Monitoring o en Prometheus para problemas que afecten tus cargas de trabajo o tu entorno local.
Para configurar alertas en Cloud Monitoring, usa la Google Cloud consola o la API de Cloud Monitoring. Para obtener instrucciones detalladas, consulta Crea políticas de alertas. Puedes crear políticas de alertas basadas en las métricas documentadas en Registros y métricas.
Si usas Prometheus para recopilar métricas, define reglas de alertas estándar de Prometheus en tu configuración de Prometheus.
Puedes configurar alertas para los siguientes problemas:
| Problema | Descripción | Sistema de supervisión | Detalles |
|---|---|---|---|
| Tiempo de inactividad de la carga de trabajo | Los pods o las VMs no se inician o se reinician de forma continua. | Prometheus | Para las cargas de trabajo de contenedores, crea alertas en kube_pod_status_phase para detectar pods en las fases Failed o Unknown. También puedes alertar sobre kube_pod_container_status_waiting_reason cuando sea igual a CrashLoopBackOff o ImagePullBackOff. |
| Cloud Monitoring | Para las cargas de trabajo de VMs que se ejecutan en pods, configura alertas con las métricas de contenedores de Kubernetes estándar en Cloud Monitoring para hacer un seguimiento del estado de los pods virt-launcher. |
||
| Agotamiento de recursos de la carga de trabajo | El uso del disco se acerca a la capacidad o el uso de memoria o CPU es alto en las cargas de trabajo. | Prometheus | Para las cargas de trabajo de contenedores, establece alertas de umbral en container_cpu_usage_seconds_total y container_memory_working_set_bytes (de cAdvisor) para identificar los pods que se acercan a sus límites de recursos. |
| Cloud Monitoring | Para el almacenamiento de máquinas, supervisa la métrica de uso del disco de la máquina edgecontainer.googleapis.com/machine/disk/utilization para detectar cuándo el almacenamiento del nodo se acerca a la capacidad. |
||
| Problemas de red local | Se pierden interfaces de red en las máquinas. | Cloud Monitoring | Supervisa si la métrica de red de la máquina edgecontainer.googleapis.com/machine/network/up es false.
|
| Pérdida de conectividad a Internet | Cloud Monitoring | Supervisa si la métrica de conectividad de red edgecontainer.googleapis.com/machine/network/connectivity es false.
|
|
| Reinicios de máquinas | Reinicios o apagados inesperados de la máquina | Cloud Monitoring | Configura alertas con las métricas edgecontainer.googleapis.com/machine/uptime y edgecontainer.googleapis.com/machine/restart_count. Para obtener más información, consulta Soluciona problemas de reinicios de máquinas. |
Google administra el hardware de Distributed Cloud conectado. No tienes acceso SSH a las máquinas ni control sobre el sistema operativo del host. Si se activan alertas basadas en métricas a nivel de la máquina, como la conectividad de red o los reinicios, tus elementos de acción se limitan a verificar la alimentación física, el cableado y las configuraciones de red local y firewall, o a escalar el problema a la asistencia de Google.