Capacidades de administración de clústeres

Las GPU en clúster, como las series de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega, y A3 High (8 GPU), están diseñadas para permitirte ejecutar clústeres de inteligencia artificial (IA) y aprendizaje automático (AA) a gran escala y proporcionan las siguientes capacidades de administración de clústeres:

Serie de máquinas compatible

Las capacidades de administración de clústeres que se describen en esta página están disponibles para la serie de máquinas de GPU en clúster, que están optimizadas para cargas de trabajo de varios nodos y a gran escala.

Estas funciones no se aplican a la serie de máquinas de GPU generales, que constan de recursos de procesamiento independientes que usan redes de VPC estándar y no admiten modos de operación de mantenimiento ni colocación conjunta densa.

En la siguiente tabla, se resumen las series de máquinas compatibles con AI Hypercomputer:

Categoría Series de máquinas Admite la administración de clústeres
GPU en clúster A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High
GPU generales A3 Edge, A2, G2, G4, N1 No

Para obtener más información sobre cada serie de máquinas, consulta Acerca de los aceleradores de GPU.

La mayoría de las capacidades de administración de clústeres solo son compatibles con la capacidad vinculada a la reserva, es decir, la infraestructura que usa el modelo de aprovisionamiento vinculado a la reserva, que solo admite tipos de máquinas de GPU en clúster. Para la capacidad que usa cualquier otro modelo de aprovisionamiento, solo están disponibles las siguientes capacidades de administración de clústeres:

Colocación conjunta de la infraestructura de GPU en clúster

Cuando usas GPU en clúster, como A4X Max, A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPU), puedes solicitar máquinas host que Compute Engine aprovisione lo más cerca posible. Estas máquinas ofrecen las siguientes funciones:

Esta disposición de recursos minimiza los saltos de red y optimiza la latencia de red más baja. Para implementar bloques de máquinas optimizadas para aceleradores que Compute Engine asigna de forma densa, puedes usar las siguientes opciones:

Colocación con reconocimiento de la topología del clúster

Después de crear GPU en clúster, puedes obtener información de la topología en los niveles de nodo y clúster. Esta información te ayuda a hacer lo siguiente:

  • Ajustar el diseño de tu aplicación o carga de trabajo para minimizar aún más la latencia de la red

  • Comprender y solucionar problemas de latencia de red y rendimiento para instancias que se comunican con frecuencia entre sí (estos problemas pueden ocurrir si las instancias están ubicadas inesperadamente lejos unas de otras)

En particular, la compatibilidad con las capacidades de topología es la siguiente:

Para obtener más información, consulta Cómo ver la topología de las instancias de procesamiento.

Modo de operación del clúster

Cuando reservas capacidad para crear instancias de procesamiento o clústeres con GPU en clúster, el tipo de máquina que reservas determina el modo de operación del clúster para las instancias. Este modo especifica cómo se comportan tus instancias después de errores de host o informes de host defectuosos. Los modos de operación disponibles para una instancia son el modo administrado, en el que Compute Engine reemplaza automáticamente cualquier máquina defectuosa , pero retiene parte de tu capacidad reservada para proporcionar a tus instancias los recursos necesarios para reiniciarse. o el modo de capacidad total, en el que tienes acceso a toda tu capacidad reservada, pero eres responsable de administrar las fallas y el mantenimiento planificado.

Para obtener más información, consulta Modo de operación de la reserva.

Programación y controles de mantenimiento del clúster

Puedes controlar el mantenimiento de las GPU en clúster mediante la programación con reconocimiento de la topología en un bloque de recursos. Esta capacidad ayuda a sincronizar las actualizaciones para que tus cargas de trabajo sean más resistentes a los eventos del host y minimizar las interrupciones. Este enfoque ayuda a mejorar el rendimiento útil de tu carga de trabajo.

Para facilitar el control total de los eventos de mantenimiento, puedes usar las siguientes funciones:

Tipo de programación del mantenimiento

Cuando reservas capacidad para crear instancias de procesamiento o clústeres de GPU en clúster, puedes definir cómo Compute Engine mantiene la infraestructura en la que se ejecutan tus instancias. Según el tipo de máquina que deseas usar para tus instancias, puedes elegir entre el mantenimiento sincronizado en todas las instancias (agrupado) o diferentes programas de mantenimiento (independientes).

Para obtener más información, consulta Tipos de programación del mantenimiento.

Administra eventos del host

Después de crear GPU en clúster y comenzar tu carga de trabajo, puedes configurar alertas y recibir notificaciones cuando se programe, inicie o complete el mantenimiento de tus instancias o bloques reservados. También puedes ver y, si es necesario, iniciar manualmente el mantenimiento en una instancia o un bloque reservado antes de la hora programada. Estas opciones te ayudan a controlar de forma proactiva y minimizar los tiempos de inactividad de tus cargas de trabajo.

Para obtener más información, consulta lo siguiente:

Herramientas de supervisión y diagnóstico del clúster

Para la supervisión y la solución de problemas, las GPU en clúster incluyen los siguientes servicios:

Próximos pasos