Descripción general de AI Hypercomputer

AI Hypercomputer es un sistema de supercomputación integrado y optimizado para admitir tus cargas de trabajo de Inteligencia Artificial (IA) y aprendizaje automático (AA). Es la cartera unificada de la infraestructura de IA de Google Cloudy proporciona un único punto de entrada para explorar, configurar y, luego, implementar hardware con rendimiento optimizado, software abierto y modelos de consumo flexibles.

AI Hypercomputer incorpora diseño a nivel del sistema y prácticas recomendadas para aumentar la eficiencia en todo el ciclo de vida del desarrollo de la IA, desde la creación de prototipos y el desarrollo hasta el entrenamiento a gran escala y la entrega en tiempo real.

Arquitectura del sistema

AI Hypercomputer integra verticalmente estos tres componentes para maximizar el rendimiento útil, la medida de la productividad real del aprendizaje automático:

  • Infraestructura optimizada para el rendimiento: Proporciona aceleradores (GPU de NVIDIA y Google Cloud TPUs), recursos de almacenamiento y redes.
    • GPUs: Se clasifican según la forma en que el sistema controla sus eventos de ciclo de vida y mantenimiento:
      • GPUs generales: Infraestructura administrada como unidades de procesamiento independientes con mantenimiento asíncrono.
      • GPU agrupadas en clústeres: Clústeres de alto rendimiento administrados como un solo sistema estrechamente acoplado con mantenimiento sincronizado.
    • TPUs: Usan hardware diseñado para realizar operaciones de matrices grandes y tienen memoria de gran ancho de banda (HBM) en el chip para modelos y tamaños de lotes más grandes. Las TPU se pueden conectar en grupos llamados porciones que escalan verticalmente tus cargas de trabajo con pocos cambios o ninguno en el código. Para obtener información sobre la infraestructura de TPU, consulta la documentación de Cloud TPU.
  • Software abierto: Ofrece versiones optimizadas de frameworks de aprendizaje automático (PyTorch, JAX y TensorFlow) y plataformas de organización. Para implementar y administrar tus aceleradores, puedes elegir entre las siguientes opciones:
    • Google Kubernetes Engine para el ajuste de escala automatizado y nativo de contenedores
    • Slurm a través de Cluster Director
    • Esquemas de Cluster Toolkit
  • Opciones de consumo: Ofrece opciones de aprovisionamiento flexibles según las necesidades de tu carga de trabajo:
    • VMs de inicio flexible, VMs Spot y Reservas: Proporcionan opciones flexibles para diferentes cargas de trabajo.
    • Programador dinámico de cargas de trabajo: Proporciona aprovisionamiento atómico para bloques completos de nodos interconectados para el entrenamiento a gran escala.

Beneficios

  • Alto rendimiento y procesamiento útil: Optimiza las capas de programación y tiempo de ejecución para maximizar el procesamiento útil, lo que ayuda a los aceleradores a dedicar más tiempo al procesamiento productivo y menos tiempo a la sobrecarga del sistema.
  • Confiabilidad integrada: Obtén acceso a funciones de confiabilidad especializadas:
    • GPUs agrupadas en clústeres: Incluye la supervisión automatizada del estado del hardware y el reemplazo proactivo de nodos.
    • GPU generales: Usa la reparación automática de nodosGoogle Cloud estándar para mantener el tiempo de actividad a nivel del Pod para las flotas de entrega.
  • Almacenamiento optimizado: Usa servicios de almacenamiento de alto rendimiento, como Google Cloud Managed Lustre y Cloud Storage Rapid, para eliminar los cuellos de botella de E/S.

Casos de uso

AI Hypercomputer satisface las necesidades de los siguientes casos de uso:

Caso de uso Ejemplos de cargas de trabajo
Cargas de trabajo de IA y AA a gran escala
  • Entrenamiento distribuido para la IA generativa
  • Inferencias para la IA generativa
  • Detección de fraudes
  • Modelos de recomendación
Inferencia y entrega de modelos
  • Detección de fraudes en tiempo real
  • Motores de recomendaciones para los resultados en tiempo real
Prototipado y desarrollo
  • Experimentos a pequeña escala
  • Desarrollo en etapa inicial

¿Qué sigue?