AI Hypercomputer proporciona una infraestructura integrada verticalmente optimizada para cargas de trabajo exigentes de inteligencia artificial (IA) y aprendizaje automático (AA). Las GPU NVIDIA de alto rendimiento se clasifican según la forma en que el sistema controla sus eventos de ciclo de vida y mantenimiento: GPU generales y GPU en clúster.
Para identificar la categoría de infraestructura óptima para tu carga de trabajo, consulta Elige tu infraestructura de aceleradores.
GPU generales
Las GPU generales se administran como unidades de procesamiento independientes mediante el uso de las APIs estándar de Compute Engine y Google Kubernetes Engine (GKE) para integrarse directamente con Google Cloudel plano de control de.
Las GPU generales incluyen las siguientes series de máquinas:
- A3 High con 1, 2 o 4 GPU (NVIDIA H100): optimizada para cargas de trabajo de entrenamiento e inferencia estándar que no requieren un clúster sincronizado de 8 GPU.
- A3 Edge (NVIDIA H100): optimizada para la inferencia que se distribuye en varios hosts con un alto rendimiento mediante redes de VPC estándar.
- A2 (NVIDIA A100): optimizada para la entrega de un solo nodo de alto rendimiento y el ajuste a pequeña escala.
- G4 (NVIDIA RTX PRO 6000): optimizada para cargas de trabajo de gráficos y de inferencia de nivel de entrada rentables.
- G2 (NVIDIA L4): optimizada para la inferencia convencional y RAG.
- N1 (NVIDIA T4 o V100): optimizada para tareas de investigación y de inferencia de nivel de entrada que priorizan el costo sobre las interconexiones de alto rendimiento.
GPU en clúster
Las GPU en clúster se administran como un solo sistema estrechamente acoplado de miles de aceleradores interconectados mediante Cluster Director.
Las GPU en clúster incluyen las siguientes series de máquinas:
- A4X Max (NVIDIA GB300): diseñada para el entrenamiento exaescala de metal desnudo y la computación de alto rendimiento, con NVIDIA GB300 Grace Blackwell Ultra Superchips.
- A4X (NVIDIA GB200) y A4 (NVIDIA B200): diseñadas para el entrenamiento de modelos de base y el entrenamiento de modelos de base exaescala.
- **A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100) y A3 High con 8 GPU (NVIDIA H100)**: optimizadas para el entrenamiento distribuido a gran escala y la inferencia de varios hosts que involucran tablas de datos masivas.
Consideraciones sobre el rendimiento de la GPU
Para evaluar y optimizar el rendimiento de tu carga de trabajo, puedes hacer un seguimiento de las métricas a nivel de hardware, como el uso de CUDA Core y Tensor Core. Para supervisar tus recursos y evaluar el rendimiento en entornos generales y en clúster, consulta lo siguiente:
- Paneles de supervisión: Haz un seguimiento del uso de la GPU y el uso de memoria en tiempo real para instancias independientes individuales o flotas de clústeres organizadas.
- Recetas de métricas de buen rendimiento: mide el porcentaje de tiempo que tus aceleradores realizan cálculos útiles en comparación con la sobrecarga del sistema, lo que se recomienda para el entrenamiento distribuido a gran escala en hardware en clúster.
¿Qué sigue?
- Para evaluar los requisitos de tu infraestructura, consulta Elige tu infraestructura de aceleradores.
- Para revisar el proceso y las opciones que debes tomar cuando inicias un clúster, consulta Planifica y crea tu infraestructura de IA.