Para ejecutar de manera eficiente cargas de trabajo de inteligencia artificial (IA) o aprendizaje automático (AA), debes seleccionar un orquestador de cargas de trabajo y una plataforma de implementación. Estos componentes funcionan de la siguiente manera:
Un organizador programa y ejecuta tus trabajos.
Una opción de implementación administra un organizador.
Después de identificar qué infraestructura de GPU (GPU agrupadas o GPU generales) usar para ejecutar tus cargas de trabajo, sigue las instrucciones de este documento para identificar el orquestador y la implementación que mejor se adapten a tu carga de trabajo y nivel de administración.
Para revisar los tipos de máquinas con GPU que puedes usar para ejecutar tus cargas de trabajo, consulta Máquinas con GPU.
Compara los organizadores y las opciones de implementación
AI Hypercomputer ofrece varios orquestadores y opciones de implementación para tus instancias de procesamiento. Estas opciones abarcan desde clústeres completamente administrados que te permiten enfocarte en tus cargas de trabajo hasta entornos autoadministrados que ofrecen un control detallado sobre cómo mantienes y actualizas tus instancias de procesamiento.
En la siguiente tabla, se comparan los orquestadores y las opciones de implementación que puedes usar cuando ejecutas cargas de trabajo de IA:
| Producto | Organizador | Complejidad técnica | Casos en los que se recomienda | Beneficio clave |
|---|---|---|---|---|
| Cluster Director | Slurm | Baja | Investigadores de IA y científicos de datos | Ciclo de vida administrado para clústeres de Slurm |
| Google Kubernetes Engine (GKE) | Kubernetes | Medio a alto | Ingenieros de AA, ingenieros de plataforma | Organización y escalamiento de contenedores |
| Cluster Toolkit | Slurm, Kubernetes | Media | Ingenieros de DevOps de AA y de plataformas | Esquemas de infraestructura como código validados |
| Compute Engine | Personalizado / Ninguno | Alta | Arquitectos de infraestructura | Control detallado sobre el SO y las redes |
Elige un organizador y una opción de implementación
Para elegir un organizador y una opción de implementación, usa el siguiente diagrama de flujo:
En el diagrama de flujo anterior, se hacen las siguientes preguntas:
¿Quieres organizar los clústeres para tus cargas de trabajo?
- Sí: Ve a la pregunta 2.
- No: Usa Compute Engine.
¿Quieres ejecutar apps alojadas en contenedores estándar?
- Sí: Usa GKE.
- No: Ve a la pregunta 3.
¿Quieres que Google administre el ciclo de vida del clúster?
- Sí: Usa Cluster Director.
- No: Usa Cluster Toolkit.
Orquestadores compatibles
Un organizador automatiza la administración de clústeres y elimina la necesidad de administrar cada instancia de procesamiento de forma individual. Los organizadores como Slurm o Kubernetes controlan la cola de trabajos, la asignación de recursos y el ajuste de escala automático.
Slurm: Es un orquestador de código abierto que se usa de uso frecuente para cargas de trabajo de IA, AA y HPC. Puedes usar Slurm con Cluster Toolkit o Cluster Director.
Kubernetes: Es una plataforma de organización de contenedores de código abierto. Puedes implementar Kubernetes directamente con GKE o a través de Cluster Toolkit.
Personalizado o ninguno: Usa Compute Engine si prefieres un orquestador diferente o quieres administrar tus instancias de procesamiento sin uno. Esta opción proporciona el mayor nivel de control, pero requiere que configures, mantengas y actualices manualmente tus instancias de procesamiento.
Plataformas de implementación compatibles
Después de identificar el organizador y la opción de implementación recomendados para tu caso de uso, revisa sus descripciones a continuación para verificar que sus niveles de administración y funciones cumplan con los requisitos de tu carga de trabajo.
Plataformas administradas y automatizadas
Si quieres evitar la sobrecarga de administrar un clúster y, en cambio, enfocarte en ejecutar tus cargas de trabajo, usa una de las siguientes plataformas administradas:
Cluster Director: Es un servicio completamente administrado que automatiza el ciclo de vida de los clústeres de Slurm. Usa Cluster Director para simplificar la configuración de tus clústeres de Slurm. Cluster Director automatiza el ciclo de vida de tus clústeres para que puedas concentrarte en ejecutar tus cargas de trabajo de IA, AA o HPC. Para obtener más información, consulta Descripción general de Cluster Director.
GKE: Es un entorno de Kubernetes administrado y optimizado para cargas de trabajo de IA y AA. Usa GKE para organizar cargas de trabajo en contenedores, integrar hardware especializado de Compute Engine y aprovechar funciones específicas de GKE, como la programación consciente de la topología (TAS). Para obtener más información, consulta la Descripción general de GKE.
Plataformas semiautoadministradas y autoadministradas
Si necesitas un control detallado sobre el sistema operativo, las configuraciones del kernel o las versiones del controlador, usa una plataforma semiadministrada o autoadministrada:
Cluster Toolkit: Es un kit de herramientas de código abierto que proporciona planos validados y personalizables para implementar entornos reproducibles de IA y AA. Ofrece gran flexibilidad y control con los principios de infraestructura como código (IaC). Para obtener más información, consulta la descripción general de Cluster Toolkit.
Compute Engine: Un servicio de procesamiento personalizable que proporciona el máximo control para crear entornos personalizados desde cero. Si bien no es un organizador independiente, Compute Engine sirve como base para los usuarios que prefieren compilar y administrar sus propias pilas personalizadas especializadas. Para obtener más información, consulta la descripción general de Compute Engine.
¿Qué sigue?
- Para obtener capacidad, consulta Opciones de consumo.
- Para implementar tu clúster, consulta Descripción general de la creación de clústeres.