Obtén información para supervisar el estado, el tiempo de actividad y las actualizaciones de tus implementaciones de Google Distributed Cloud conectado, incluidas las cargas de trabajo compatibles. Para obtener más información sobre cómo configurar la supervisión y sobre las métricas disponibles, consulta Registros y métricas.
Supervisa el estado y el tiempo de actividad de las cargas de trabajo
Eres responsable de supervisar el estado y el tiempo de actividad de tus cargas de trabajo (contenedores y máquinas virtuales) que se ejecutan en tu implementación de Distributed Cloud conectado.
Cargas de trabajo de contenedores
Para supervisar el estado y el tiempo de actividad de las cargas de trabajo en contenedores que implementas, te recomendamos que uses la solución de métricas de Prometheus. Puedes configurar Prometheus para recopilar métricas de tus pods y servicios. Google supervisa y administra automáticamente los servicios del sistema administrados por Google. Para obtener más información sobre cómo configurar Prometheus, consulta Recopila métricas con Prometheus.
Usa las siguientes métricas clave para supervisar las cargas de trabajo de contenedores. Si usas Prometheus, eres responsable de implementar y administrar Kube State Metrics para exponer estas métricas específicas para tus cargas de trabajo:
kube_pod_status_phase: Supervisa los pods en las fasesFailedoUnknown.kube_pod_container_status_waiting_reason: Identifica los pods atascados enCrashLoopBackOffoImagePullBackOff.container_cpu_usage_seconds_totalycontainer_memory_working_set_bytes(de cAdvisor): Supervisa el consumo de recursos para evitar problemas de memoria insuficiente (OOM).
Cargas de trabajo de máquinas virtuales
En Distributed Cloud conectado, las máquinas virtuales (VMs) se ejecutan dentro de los pods de Kubernetes estándar, que suelen tener el prefijo virt-launcher-. Supervisa el estado de la VM principalmente verificando el estado del recurso personalizado VirtualMachine o supervisando las métricas de la aplicación desde la VM.
Usa las métricas subyacentes del pod virt-launcher como indicadores secundarios para los siguientes detalles:
- Uso de recursos: Supervisa el consumo de CPU y memoria de los pods de inicio para garantizar que las VMs tengan recursos suficientes.
- Fase del pod: Haz un seguimiento de las fases del pod de inicio para identificar las VMs que no se inician o fallan.
Para ajustar los recursos asignados a una VM, modifica la especificación del recurso personalizado de la VM. No modifiques directamente los archivos YAML subyacentes del pod virt-launcher, ya que la plataforma los administra. Cualquier cambio directo se anulará o generará errores de conciliación.
Para solucionar problemas de VMs atascadas en un estado pendiente, consulta Soluciona problemas de máquinas virtuales atascadas en estado pendiente.
Supervisa las actualizaciones de Distributed Cloud conectado
Supervisa el progreso y el estado de las actualizaciones de software de Distributed Cloud conectado con las métricas de Cloud Monitoring y los comandos de gcloud.
Google programa y ejecuta las actualizaciones. La supervisión es estrictamente para la visibilidad y la planificación de la migración de cargas de trabajo.
Para obtener instrucciones detalladas sobre cómo verificar si una actualización está en curso, supervisar su estado y solucionar problemas de actualizaciones fallidas, consulta Soluciona problemas de actualizaciones de software.
Supervisa el estado del almacenamiento local
Distributed Cloud conectado supervisa continuamente el estado de sus dispositivos de almacenamiento y alerta a Google cuando se debe reemplazar una unidad física. Google trabaja contigo para programar una visita y reemplazar la unidad con fallas. Puedes supervisar el estado de tu almacenamiento con alertas de condición de Kubernetes, como DiskPressure.
Supervisa el estado del almacenamiento del sistema
Puedes supervisar el estado del almacenamiento del sistema de Distributed Cloud conectado con uno de los siguientes métodos:
Prometheus con Kube State Metrics (PromQL) Implementa y administra Kube State Metrics en tu clúster para exponer las métricas de condición de Kubernetes.
Métricas de Cloud Monitoring Crea políticas de alertas basadas en métricas de nivel de host exportadas a Cloud Monitoring.
Supervisa el estado del almacenamiento del sistema con Prometheus
Para supervisar el estado del almacenamiento del sistema con Prometheus con Kube State Metrics (PromQL), configura las siguientes alertas:
Alerta de inmediato cuando una condición de nodo ingresa al estado
DiskPressure:kube_node_status_condition{condition="DiskPressure",status="true"} == 1Alerta de forma proactiva antes de que se superen los umbrales de expulsión verificando cuándo el uso del disco supera un umbral operacional:
(1 - (node_filesystem_avail_bytes{mountpoint="/mnt/shared_lpvs"} / node_filesystem_size_bytes{mountpoint="/mnt/shared_lpvs"})) > THRESHOLDReemplaza
THRESHOLDpor el umbral operacional objetivo en el rango0.00~1.00. Google recomienda establecer este valor en0.85.
Supervisa el estado del almacenamiento del sistema con Cloud Monitoring
Para supervisar el estado del almacenamiento del sistema con métricas de Cloud Monitoring, crea una política de alertas con los siguientes parámetros:
- Métrica:
edgecontainer.googleapis.com/machine/disk/utilization - Alcance: Esta métrica informa específicamente el uso del disco del sistema de archivos de la partición del sistema local del nodo (
/dev/mapper/shared_lpvs_encrypted). - Umbral: Configura un umbral de alertas cuando el uso del disco sea superior al 85%. Esto detectará la saturación del disco del sistema antes de que se produzca un evento
DiskPressurede nodo físico.
Supervisa el estado del almacenamiento de las cargas de trabajo
Puedes supervisar el estado del almacenamiento de las cargas de trabajo con las métricas de volumen de Kubelet o directamente con la telemetría a nivel de la aplicación, según el modo de volumen que use la carga de trabajo.
Modo de volumen
FilesystemPuedes supervisar los volúmenes del sistema de archivos con Prometheus recopilando las siguientes métricas de volumen de Kubelet:kubelet_volume_stats_capacity_byteskubelet_volume_stats_available_byteskubelet_volume_stats_used_byteskubelet_volume_stats_inodes_usedkubelet_volume_stats_inodes_free
Modo de volumen
BlockLos volúmenes de bloque sin procesar son invisibles para Kubelet. Para supervisar su estado, debes usar métricas de almacenamiento a nivel de la aplicación o de Symcloud.
Supervisión de varios clústeres
Si administras muchos clústeres de Distributed Cloud conectado, te recomendamos que uses Cloud Monitoring para agregar y filtrar métricas.
Usa etiquetas de recursos: Las métricas exportadas a Cloud Monitoring incluyen etiquetas que identifican la fuente. Las etiquetas disponibles dependen del tipo de recurso:
Para las métricas de clúster y contenedor, como
k8s_container, las etiquetas clave incluyen los siguientes valores:project_id: El Google Cloud proyecto que aloja el clúster.location: La Google Cloud región en la que está registrado el clúster.cluster_name: El nombre del clúster.
Para las métricas de hardware, como
edgecontainer.googleapis.com/machine, las etiquetas clave incluyen los siguientes valores:resource_container: El Google Cloud proyecto asociado con el hardware.location: La Google Cloud región en la que está registrada la zona de Distributed Cloud conectado.machine_id: El identificador de la máquina.
Las métricas de hardware no incluyen una etiqueta
cluster_namedirectamente.
Crea paneles personalizados: Crea paneles que muestren indicadores clave de estado en toda tu flota. Los indicadores clave de estado incluyen la conectividad, el estado de la VM y el uso de recursos. Para mostrar datos de varios clústeres en un solo gráfico, usa comodines o operaciones de agrupación.
Configura alertas de varios clústeres: Configura políticas de alertas que se apliquen a varios clústeres. Por ejemplo, puedes crear una alerta que se active si alguna máquina de algún clúster pierde la conectividad.
Estrategia de alertas
La supervisión y el mantenimiento de Distributed Cloud conectado son una responsabilidad compartida. En esta sección, se explica sobre qué alerta Google y cómo puedes configurar tus propias políticas de alertas.
Sobre qué alerta Google
Google supervisa continuamente la infraestructura subyacente. Toma medidas y te notifica si es necesario en las siguientes situaciones:
- Fallas de hardware: Fallas en la fuente de alimentación, fallas en el ventilador, sobrecalentamiento, o fallas en el disco, como un disco que alcanza su umbral de repuesto o el final de su vida útil. Google supervisa continuamente el estado de sus dispositivos de almacenamiento internos y activa un reemplazo automático cuando falla un dispositivo de almacenamiento.
- Problemas de conectividad: Pérdida completa de la conexión entre la zona de Distributed Cloud conectado y Google Cloud.
- Estado del plano de control: Fallas en el plano de control de Kubernetes o en los servicios del sistema administrados por Google.
- Fallas de actualización: Procesos de actualización automatizados que se atascan o fallan.
Configura alertas
Configura tus propias políticas de alertas en Cloud Monitoring o en Prometheus para problemas que afecten tus cargas de trabajo o tu entorno local.
Para configurar alertas en Cloud Monitoring, usa la Google Cloud consola de o la API de Cloud Monitoring. Para obtener instrucciones detalladas, consulta Crea políticas de alertas. Puedes crear políticas de alertas basadas en las métricas documentadas en Registros y métricas.
Si usas Prometheus para recopilar métricas, define reglas de alertas estándar de Prometheus en tu configuración de Prometheus.
Puedes configurar alertas para los siguientes problemas:
| Problema | Descripción | Sistema de supervisión | Detalles |
|---|---|---|---|
| Tiempo de inactividad de la carga de trabajo | Los pods o las VMs no se inician o se reinician de forma continua. | Prometheus | Para las cargas de trabajo de contenedores, crea alertas en kube_pod_status_phase para detectar pods en las fases Failed o Unknown. También puedes alertar sobre kube_pod_container_status_waiting_reason cuando es igual a CrashLoopBackOff o ImagePullBackOff. |
| Cloud Monitoring | Para las cargas de trabajo de VMs que se ejecutan en pods, configura alertas con métricas de contenedores de Kubernetes estándar en Cloud Monitoring para hacer un seguimiento del estado de los pods virt-launcher. |
||
| Agotamiento de los recursos de la carga de trabajo | Uso del disco que se acerca a la capacidad o uso elevado de memoria o CPU en las cargas de trabajo | Prometheus | Para las cargas de trabajo de contenedores, establece alertas de umbral en container_cpu_usage_seconds_total y container_memory_working_set_bytes (de cAdvisor) para identificar los pods que se acercan a sus límites de recursos. |
| Cloud Monitoring | Para el almacenamiento de máquinas, supervisa la métrica de uso del disco de la máquina edgecontainer.googleapis.com/machine/disk/utilization para detectar cuándo el almacenamiento del nodo se acerca a la capacidad. |
||
| Problemas de red local | Se descartan las interfaces de red en las máquinas. | Cloud Monitoring | Supervisa si la métrica de red de la máquina edgecontainer.googleapis.com/machine/network/up es false.
|
| Pérdida de conectividad a Internet | Cloud Monitoring | Supervisa si la métrica de conectividad de red edgecontainer.googleapis.com/machine/network/connectivity es false.
|
|
| Reinicios de máquinas | Reinicios o apagados inesperados de la máquina | Cloud Monitoring | Configura alertas con las métricas edgecontainer.googleapis.com/machine/uptime y edgecontainer.googleapis.com/machine/restart_count. Para obtener más información, consulta Soluciona problemas de reinicios de máquinas. |
| Agotamiento del almacenamiento del sistema | El almacenamiento del sistema se queda sin espacio. | Cloud Monitoring | Configura alertas con la métrica edgecontainer.googleapis.com/machine/disk/utilization. Para obtener más información, consulta Supervisa el estado del almacenamiento del sistema. |
Google administra el hardware de Distributed Cloud conectado. No tienes acceso SSH a las máquinas ni control sobre el sistema operativo del host. Si se activan alertas basadas en métricas a nivel de la máquina, como la conectividad de red o los reinicios, tus elementos de acción se limitan a verificar la alimentación física, el cableado y las configuraciones de red local y firewall, o bien a escalar el problema a la asistencia de Google.