Elige un organizador y una opción de implementación

Para ejecutar de manera eficiente las cargas de trabajo de inteligencia artificial (IA) o aprendizaje automático (AA), debes seleccionar un organizador de cargas de trabajo y una plataforma de implementación. Estos componentes funcionan de la siguiente manera:

  • Un organizador programa y ejecuta tus trabajos.

  • Una opción de implementación administra un organizador.

Después de identificar qué infraestructura de GPU (GPUs en clúster o GPUs generales) usar para ejecutar tus cargas de trabajo, sigue las instrucciones de este documento para identificar el organizador y la implementación que mejor se adapten a tu carga de trabajo y nivel de administración.

Para revisar los tipos de máquinas con GPU que puedes usar para ejecutar tus cargas de trabajo, consulta Máquinas con GPU.

Compara los organizadores y las opciones de implementación

AI Hypercomputer ofrece varios organizadores y opciones de implementación para tus instancias de procesamiento. Estas opciones van desde clústeres completamente administrados que te permiten enfocarte en tus cargas de trabajo hasta entornos autoadministrados que ofrecen un control detallado sobre cómo mantienes y actualizas tus instancias de procesamiento.

En la siguiente tabla, se comparan los organizadores y las opciones de implementación que puedes usar cuando ejecutas cargas de trabajo de IA:

Producto Organizador Complejidad técnica Casos en los que se recomienda Beneficio clave
Cluster Director Slurm Baja Investigadores de IA, científicos de datos Ciclo de vida administrado para clústeres de Slurm
Google Kubernetes Engine (GKE) Kubernetes Medio a alto Ingenieros de AA, ingenieros de plataformas Organización y escalamiento de contenedores
Cluster Toolkit Slurm, Kubernetes Medio Ingenieros de MLOps, ingenieros de plataformas Planos validados de infraestructura como código
Compute Engine Personalizado o ninguno Alta Arquitectos de infraestructura Control detallado sobre el SO y las redes

Elige un organizador y una opción de implementación

Para elegir un organizador y una opción de implementación, usa el siguiente diagrama de flujo:

Árbol de decisión para seleccionar un organizador y una opción de implementación.

En el diagrama de flujo anterior, se hacen las siguientes preguntas:

  1. ¿Quieres la organización de clústeres para tus cargas de trabajo?

    • : Ve a la pregunta 2.
    • No: Usa Compute Engine.
  2. ¿Quieres ejecutar apps alojadas en contenedores estándar?

    • : Usa GKE.
    • No: Ve a la pregunta 3.
  3. ¿Quieres que Google administre el ciclo de vida del clúster?

    • : Usa Cluster Director.
    • No: Usa Cluster Toolkit.

Organizadores admitidos

Un organizador automatiza la administración de clústeres y elimina la necesidad de administrar cada instancia de procesamiento de forma individual. Los organizadores como Slurm o Kubernetes controlan la puesta en cola de trabajos, la asignación de recursos y el ajuste de escala automático.

  • Slurm: Es un organizador de código abierto de uso frecuente para cargas de trabajo de IA, AA, y HPC. Puedes usar Slurm con Cluster Toolkit o Cluster Director.

  • Kubernetes: Es una plataforma de organización de contenedores de código abierto. Puedes implementar Kubernetes con GKE directamente o a través de Cluster Toolkit.

  • Personalizado o ninguno: Usa Compute Engine si prefieres un organizador diferente o quieres administrar tus instancias de procesamiento sin uno. Esta opción proporciona el nivel más alto de control, pero requiere que configures, mantengas y actualices tus instancias de procesamiento de forma manual.

Plataformas de implementación admitidas

Después de identificar el organizador y la opción de implementación recomendados para tu caso de uso, revisa sus descripciones a continuación para verificar que sus niveles de administración y funciones cumplan con los requisitos de tu carga de trabajo.

Plataformas administradas y automatizadas

Si quieres evitar la sobrecarga de administrar un clúster y, en cambio, enfocarte en ejecutar tus cargas de trabajo, usa una de las siguientes plataformas administradas:

  • Cluster Director: Es un servicio completamente administrado que automatiza el ciclo de vida de los clústeres de Slurm. Usa Cluster Director para simplificar la configuración de tus clústeres de Slurm. Cluster Director automatiza el ciclo de vida de tus clústeres para que puedas enfocarte en ejecutar tus cargas de trabajo de IA, AA o HPC. Para obtener más información, consulta Descripción general de Cluster Director.

  • GKE: Es un entorno de Kubernetes administrado y optimizado para cargas de trabajo de IA y AA. Usa GKE para organizar cargas de trabajo alojadas en contenedores, integrar hardware especializado de Compute Engine y aprovechar las funciones específicas de GKE, como la programación con reconocimiento de topología (TAS). Para obtener más información, consulta Descripción general de GKE.

Plataformas semiautoadministradas y autoadministradas

Si necesitas un control detallado sobre el sistema operativo, las configuraciones del kernel o las versiones del controlador, usa una plataforma semiautoadministrada o autoadministrada:

  • Cluster Toolkit: Es un kit de herramientas de código abierto que proporciona planos validados y personalizables para implementar entornos reproducibles de IA y AA. Ofrece alta flexibilidad y control con los principios de infraestructura como código (IaC). Para obtener más información, consulta Descripción general de Cluster Toolkit.

  • Compute Engine: Es un servicio de procesamiento personalizable que proporciona el máximo control para crear entornos personalizados desde cero. Si bien no es un organizador independiente, Compute Engine sirve como base para los usuarios que prefieren compilar y administrar sus propias pilas personalizadas especializadas. Para obtener más información, consulta Descripción general de Compute Engine.

¿Qué sigue?