Descripción general de las GPUs agrupadas en clústeres

Las GPU en clústeres están optimizadas para cargas de trabajo de inteligencia artificial (IA) y aprendizaje automático (AA) que priorizan el entrenamiento distribuido a gran escala, la inferencia de varios hosts y las tareas complejas de computación de alto rendimiento (HPC).

Las GPU en clústeres permiten que los equipos implementen y escalen miles de aceleradores interconectados como un solo sistema estrechamente acoplado mediante el uso de estructuras de redes especializadas y mantenimiento sincronizado. Son ideales para cargas de trabajo que requieren sincronización extrema de procesamiento, memoria y redes de alta velocidad. Entre los casos de uso comunes, se incluyen el entrenamiento previo de modelos de base con billones de parámetros, la entrega de modelos de frontera y las simulaciones para el descubrimiento de fármacos.

Características clave de las GPU en clústeres

  • Mantenimiento sincronizado: Google Cloud Actualiza todos los nodos del clúster de forma simultánea, lo que evita que un solo reinicio de nodo detenga un trabajo.
  • Supervisión automática del estado: El sistema identifica de forma proactiva a los rezagados y supervisa las fallas de hardware o la corrupción silenciosa de datos.
  • Reemplazo proactivo de nodos: El sistema expulsa y reprograma las VMs de bajo rendimiento en máquinas en buen estado de un grupo de repuesto.
  • Topología encarrilada: Una topología encarrilada aísla el tráfico de GPU a GPU de la comunicación estándar del host para garantizar un rendimiento sin fluctuaciones para la coordinación masiva de varios nodos.
  • Protocolos avanzados: Estas series de máquinas admiten interconexiones de alto ancho de banda , incluido GPUDirect RDMA (basado en RoCE).

Familias de GPU en clústeres y especificaciones técnicas

Revisa las cargas de trabajo y las especificaciones de hardware de las series de máquinas de GPU en clústeres premium en estas tablas. Para el entrenamiento a escala exa, usa las series A4X o A3 Ultra.

Series A4X Max y A4X

Si entrenas modelos de base masivos a escala exa o ejecutas simulaciones de computación de alto rendimiento (HPC) complejas y de hardware físico, usa las series de máquinas A4X Max o A4X. Estas series incluyen NVIDIA GB300 Grace Blackwell Ultra Superchips para manejar demandas extremas de procesamiento y memoria.

A4X Max (hardware físico)

Los tipos de máquinas A4X Max usan NVIDIA GB300 Grace Blackwell Ultra Superchips (nvidia-gb300) y son ideales para el entrenamiento y la entrega de modelos de base. Los tipos de máquinas A4X Max están disponibles como instancias de hardware físico.

A4X Max es una plataforma a escala exa basada en NVIDIA GB300 NVL72. Cada máquina tiene dos sockets con CPU NVIDIA Grace con núcleos Arm Neoverse V2. Estas CPU están conectadas a cuatro GPU NVIDIA B300 Blackwell con comunicación rápida de chip a chip (NVLink-C2C).

NVIDIA GB300 Grace Blackwell Ultra Superchips conectados
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3e)
a4x-maxgpu-4g-metal 144 960 12,000 6 3,600 4 1,116

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.

A4X

Los tipos de máquinas A4X usan NVIDIA GB200 Grace Blackwell Superchips (nvidia-gb200) y son ideales para el entrenamiento y la entrega de modelos de base.

A4X es una plataforma a escala exa basada en NVIDIA GB200 NVL72. Cada máquina tiene dos sockets con CPU NVIDIA Grace con núcleos Arm Neoverse V2. Estas CPU están conectadas a cuatro GPU NVIDIA B200 Blackwell con comunicación rápida de chip a chip (NVLink-C2C) .

NVIDIA GB200 Grace Blackwell Superchips conectados
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3e)
a4x-highgpu-4g 140 884 12,000 6 2,000 4 744

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.

Serie A4

Si tu objetivo es entrenar modelos de base de vanguardia que requieran una escala de procesamiento paralelo masiva, usa la serie de máquinas A4 para optimizar el tiempo de procesamiento y maximizar el rendimiento del hardware.

Los tipos de máquinas A4 tienen GPU NVIDIA B200 Blackwell (nvidia-b200) conectadas y son ideales para el entrenamiento y la entrega de modelos de base.

GPU NVIDIA B200 Blackwell conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3e)
a4-highgpu-8g 224 3,968 12,000 10 3,600 8 1,440

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.

Serie A3 (Ultra, Mega y High con 8 GPU)

Si necesitas ejecutar ejecuciones de entrenamiento distribuido a gran escala o entregar modelos de vanguardia en varios hosts con tablas de conjuntos de datos grandes, usa la serie de máquinas A3 para minimizar la latencia de red de host a host.

A3 Ultra

GPU NVIDIA H200 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3e)
a3-ultragpu-8g 224 2,952 12,000 10 3,600 8 1128

A3 Mega

GPU NVIDIA H100 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3)
a3-megagpu-8g 208 1,872 6,000 9 1,800 8 640

A3 High

GPU NVIDIA H100 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1,500 1 50 2 160
a3-highgpu-4g 104 936 3,000 1 100 4 320
a3-highgpu-8g 208 1,872 6,000 5 1,000 8 640

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.

Adquisición de capacidad

La adquisición de capacidad de procesamiento para las GPU en clústeres requiere coordinación para administrar la oferta y la demanda de aceleradores de alto rendimiento. Debido a que estos recursos se encuentran físicamente dentro de estructuras de redes especializadas, debes solicitarlos a través de flujos de trabajo administrados.

Puedes reservar capacidad a través de tu equipo de cuentas o usar reservas futuras y Dynamic Workload Scheduler.

¿Qué sigue?