Para ejecutar cargas de trabajo de inteligencia artificial (IA), aprendizaje automático (AA) o computación de alto rendimiento (HPC), puedes implementar instancias y clústeres de Compute Engine optimizados para IA que usen máquinas A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPUs). Para obtener más información sobre las funciones de estas máquinas que te permiten ejecutar clústeres de IA y AA a gran escala, consulta Descripción general de la administración de clústeres.
Puedes crear instancias A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPUs) directamente desde Compute Engine o a través de otros servicios que se ejecutan en instancias de Compute Engine, como Cluster Toolkit o Google Kubernetes Engine.
Para obtener la opción más adecuada para crear tus instancias de procesamiento o clústeres para tu caso de uso, elige una de las siguientes:
| Opción | Caso práctico |
|---|---|
| Cluster Director | Quieres un servicio completamente administrado que automatice la configuración de tus clústeres de Slurm. Cluster Director te ayuda a configurar los recursos de procesamiento, redes y almacenamiento para tus clústeres y, así, maximizar el rendimiento y minimizar los tiempos de inactividad. Para obtener más información, consulta Crea un clúster de Slurm completamente administrado para cargas de trabajo de IA. |
| Cluster Toolkit | Quieres usar software de código abierto que simplifique el proceso para implementar clústeres de Slurm y GKE. Cluster Toolkit está diseñado para ser altamente personalizable y extensible. Puedes usar planos para aprovisionar recursos de redes y almacenamiento. Para obtener más información, consulta lo siguiente: |
| GKE | Quieres la máxima flexibilidad para configurar tu clúster de Google Kubernetes Engine según las necesidades de tu carga de trabajo. Para obtener más información, consulta lo siguiente: |
| Usa Compute Engine | Quieres tener control total de la capa de infraestructura para poder configurar tu propio orquestador. Para obtener más información, consulta lo siguiente:
|
¿Qué sigue?
- Obtén información sobre la infraestructura optimizada para el rendimiento de AI Hypercomputer: