Acerca de los aceleradores de GPU

AI Hypercomputer proporciona una infraestructura integrada verticalmente optimizada para cargas de trabajo exigentes de inteligencia artificial (IA) y aprendizaje automático (AA). Las GPU NVIDIA de alto rendimiento se clasifican según la forma en que el sistema controla sus eventos de ciclo de vida y mantenimiento: GPU generales y GPU en clúster.

Para identificar la categoría de infraestructura óptima para tu carga de trabajo, consulta Elige tu infraestructura de aceleradores.

GPU generales

Las GPU generales se administran como unidades de procesamiento independientes mediante el uso de las APIs estándar de Compute Engine y Google Kubernetes Engine (GKE) para integrarse directamente con Google Cloudel plano de control de.

Las GPU generales incluyen las siguientes series de máquinas:

  • A3 High con 1, 2 o 4 GPU (NVIDIA H100): optimizada para cargas de trabajo de entrenamiento e inferencia estándar que no requieren un clúster sincronizado de 8 GPU.
  • A3 Edge (NVIDIA H100): optimizada para la inferencia que se distribuye en varios hosts con un alto rendimiento mediante redes de VPC estándar.
  • A2 (NVIDIA A100): optimizada para la entrega de un solo nodo de alto rendimiento y el ajuste a pequeña escala.
  • G4 (NVIDIA RTX PRO 6000): optimizada para cargas de trabajo de gráficos y de inferencia de nivel de entrada rentables.
  • G2 (NVIDIA L4): optimizada para la inferencia convencional y RAG.
  • N1 (NVIDIA T4 o V100): optimizada para tareas de investigación y de inferencia de nivel de entrada que priorizan el costo sobre las interconexiones de alto rendimiento.

GPU en clúster

Las GPU en clúster se administran como un solo sistema estrechamente acoplado de miles de aceleradores interconectados mediante Cluster Director.

Las GPU en clúster incluyen las siguientes series de máquinas:

Consideraciones sobre el rendimiento de la GPU

Para evaluar y optimizar el rendimiento de tu carga de trabajo, puedes hacer un seguimiento de las métricas a nivel de hardware, como el uso de CUDA Core y Tensor Core. Para supervisar tus recursos y evaluar el rendimiento en entornos generales y en clúster, consulta lo siguiente:

  • Paneles de supervisión: Haz un seguimiento del uso de la GPU y el uso de memoria en tiempo real para instancias independientes individuales o flotas de clústeres organizadas.
  • Recetas de métricas de buen rendimiento: mide el porcentaje de tiempo que tus aceleradores realizan cálculos útiles en comparación con la sobrecarga del sistema, lo que se recomienda para el entrenamiento distribuido a gran escala en hardware en clúster.

¿Qué sigue?