- Colocación de recursos de infraestructura de IA
- Colocación consciente de la topología del clúster
- Modo de operación del clúster
- Programación y controles de mantenimiento del clúster
- Herramientas de supervisión y diagnóstico del clúster
La mayoría de las capacidades de administración de clústeres solo son compatibles con la capacidad vinculada a la reserva, es decir, la infraestructura que usa el modelo de aprovisionamiento vinculado a la reserva, que solo admite tipos de máquinas de GPU en clúster. Para la capacidad que usa cualquier otro modelo de aprovisionamiento, solo están disponibles las siguientes capacidades de administración de clústeres:
- Colocación de recursos de infraestructura de IA
- Colocación consciente de la topología del clúster
- Administra los eventos del host en todas las instancias
Colocación de recursos de infraestructura de IA
Cuando usas GPU en clúster, como A4X Max, A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPU), puedes solicitar máquinas host que Compute Engine aprovisione lo más cerca posible. Estas máquinas ofrecen las siguientes funciones:
Compute Engine aprovisiona las máquinas como bloques de recursos.
Una interconexión de estructura de red de aprendizaje automático (AA) dinámica interconecta las máquinas.
Esta disposición de recursos minimiza los saltos de red y optimiza la latencia de red más baja. Para implementar bloques de máquinas optimizadas para aceleradores que Compute Engine asigna de forma densa, puedes usar las siguientes opciones:
Los recursos deben asignarse de forma densa entre sí cuando realizas una o más de las siguientes acciones:
Crea recursos que usen la misma reserva futura en AI Hypercomputer o reserva futura en modo calendario.
Implementa un grupo de instancias administrado (MIG) que use solicitudes de cambio de tamaño y crea los recursos en la misma solicitud.
Especifica que los recursos usen la misma política de posición compacta o política de carga de trabajo que especifica un valor de distancia máxima. En particular, los recursos solo deben estar tan cerca como lo especifica el valor de distancia máxima de la política.
Los recursos se asignan de forma densa entre sí de manera opcional, según la disponibilidad de mejor esfuerzo, cuando realizas una o más de las siguientes acciones:
Crea recursos en la misma solicitud para las VMs de inicio flexible.
Especifica que los recursos usen la misma política de posición compacta o política de carga de trabajo que no especifica una distancia máxima.
Colocación consciente de la topología del clúster
Después de crear GPU en clúster, puedes obtener información de la topología a nivel del nodo y del clúster. Esta información te ayuda a hacer lo siguiente:
Ajusta el diseño de tu aplicación o carga de trabajo para minimizar aún más la latencia de la red.
Comprende y soluciona problemas de latencia de red y rendimiento para instancias que se comunican con frecuencia entre sí. Estos problemas pueden ocurrir si las instancias están ubicadas inesperadamente lejos unas de otras.
En particular, la información de la topología se admite de la siguiente manera:
La información de la topología funciona mejor con la capacidad vinculada a la reserva, que es necesaria para ver la topología de una reserva.
En el caso de las VMs interrumpibles, la información de la topología solo aparece cuando una máquina usa una política de posición compacta o una política de carga de trabajo.
Para obtener más información, consulta lo siguiente:
- En el caso de las instancias y los clústeres de Slurm, consulta Cómo ver la topología de las instancias de procesamiento.
- En el caso de los clústeres de GKE, consulta Cómo ver la topología de nodos de GKE y Programar cargas de trabajo de GKE con la programación consciente de la topología (TAS).
Modo de operación del clúster
Cuando reservas capacidad vinculada a la reserva para crear instancias de procesamiento o clústeres, el tipo de máquina que reservas determina el modo de operación del clúster para las instancias. Este modo especifica cómo se comportan tus instancias después de errores de host o informes de host defectuosos. Los modos de operación disponibles para una instancia son el modo administrado, en el que Compute Engine reemplaza automáticamente cualquier máquina defectuosa , pero retiene parte de tu capacidad reservada para proporcionar a tus instancias los recursos necesarios para reiniciarse. O el modo de capacidad total, en el que tienes acceso a toda tu capacidad reservada, pero eres responsable de administrar las fallas y el mantenimiento planificado.
Para obtener más información, consulta Modo de operación de la reserva.
Programación y controles de mantenimiento del clúster
Puedes controlar el mantenimiento de las GPU en clúster mediante la programación consciente de la topología en un bloque de recursos. Esta capacidad ayuda a sincronizar las actualizaciones para que tus cargas de trabajo sean más resistentes a los eventos del host y minimicen las interrupciones. Este enfoque ayuda a mejorar el rendimiento útil de tu carga de trabajo.
Para facilitar el control total de los eventos de mantenimiento, puedes usar las siguientes funciones:
Tipo de programación del mantenimiento
Cuando reservas capacidad vinculada a la reserva para crear instancias de procesamiento o clústeres de GPU en clúster, puedes definir cómo Compute Engine mantiene la infraestructura en la que se ejecutan tus instancias. Según el tipo de máquina que deseas usar para tus instancias, puedes elegir entre el mantenimiento sincronizado en todas las instancias (agrupado) o diferentes programas de mantenimiento (independientes).
Para obtener más información, consulta Tipos de programación del mantenimiento.
Administra eventos del host
Después de crear GPU en clúster y comenzar tu carga de trabajo, puedes configurar alertas y recibir notificaciones cuando se programe, inicie o complete el mantenimiento de tus instancias o bloques reservados. También puedes ver y, si es necesario, iniciar manualmente el mantenimiento en una instancia o bloque reservado antes de la hora programada. Estas opciones te ayudan a controlar de forma proactiva y minimizar los tiempos de inactividad de tus cargas de trabajo.
Para obtener más información, consulta lo siguiente:
Herramientas de supervisión y diagnóstico del clúster
Para la supervisión y la solución de problemas, los tipos de máquinas de GPU en clúster incluyen los siguientes servicios para la capacidad vinculada a la reserva:
Predicción de la degradación del estado de la VM, que te ayuda a identificar las VMs que probablemente se degraden en las próximas cinco horas.
Informes de host defectuosos, que puedes usar para marcar problemas con máquinas host individuales.
Compatibilidad con las métricas de Cloud Monitoring, que te ayudan a supervisar las redes y el rendimiento de las GPU.