Las GPU en clústeres están optimizadas para cargas de trabajo de inteligencia artificial (IA) y aprendizaje automático (AA) que priorizan el entrenamiento distribuido a gran escala, la inferencia de varios hosts y las tareas complejas de computación de alto rendimiento (HPC).
Las GPU en clústeres permiten que los equipos implementen y escalen miles de aceleradores interconectados como un solo sistema estrechamente acoplado mediante el uso de estructuras de redes especializadas y mantenimiento sincronizado. Son ideales para cargas de trabajo que requieren sincronización extrema de procesamiento, memoria y redes de alta velocidad. Entre los casos de uso comunes, se incluyen el entrenamiento previo de modelos de base con billones de parámetros, la entrega de modelos de frontera y las simulaciones para el descubrimiento de fármacos.
Características clave de las GPU en clústeres
- Mantenimiento sincronizado: Google Cloud Actualiza todos los nodos del clúster de forma simultánea, lo que evita que un solo reinicio de nodo detenga un trabajo.
- Supervisión automática del estado: El sistema identifica de forma proactiva a los rezagados y supervisa las fallas de hardware o la corrupción silenciosa de datos.
- Reemplazo proactivo de nodos: El sistema expulsa y reprograma las VMs de bajo rendimiento en máquinas en buen estado de un grupo de repuesto.
- Topología encarrilada: Una topología encarrilada aísla el tráfico de GPU a GPU de la comunicación estándar del host para garantizar un rendimiento sin fluctuaciones para la coordinación masiva de varios nodos.
- Protocolos avanzados: Estas series de máquinas admiten interconexiones de alto ancho de banda , incluido GPUDirect RDMA (basado en RoCE).
Familias de GPU en clústeres y especificaciones técnicas
Revisa las cargas de trabajo y las especificaciones de hardware de las series de máquinas de GPU en clústeres premium en estas tablas. Para el entrenamiento a escala exa, usa las series A4X o A3 Ultra.
Series A4X Max y A4X
Si entrenas modelos de base masivos a escala exa o ejecutas simulaciones de computación de alto rendimiento (HPC) complejas y de hardware físico, usa las series de máquinas A4X Max o A4X. Estas series incluyen NVIDIA GB300 Grace Blackwell Ultra Superchips para manejar demandas extremas de procesamiento y memoria.
A4X Max (hardware físico)
Los tipos de máquinas A4X Max
usan NVIDIA GB300 Grace Blackwell Ultra Superchips (nvidia-gb300) y
son ideales para el entrenamiento y la entrega de modelos de base. Los tipos de máquinas A4X Max están disponibles
como instancias de hardware físico.
A4X Max es una plataforma a escala exa basada en NVIDIA GB300 NVL72. Cada máquina tiene dos sockets con CPU NVIDIA Grace con núcleos Arm Neoverse V2. Estas CPU están conectadas a cuatro GPU NVIDIA B300 Blackwell con comunicación rápida de chip a chip (NVLink-C2C).
| NVIDIA GB300 Grace Blackwell Ultra Superchips conectados | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12,000 | 6 | 3,600 | 4 | 1,116 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de
las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de red,
consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el
almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.
A4X
Los tipos de máquinas A4X
usan NVIDIA GB200 Grace Blackwell Superchips (nvidia-gb200) y
son ideales para el entrenamiento y la entrega de modelos de base.
A4X es una plataforma a escala exa basada en NVIDIA GB200 NVL72. Cada máquina tiene dos sockets con CPU NVIDIA Grace con núcleos Arm Neoverse V2. Estas CPU están conectadas a cuatro GPU NVIDIA B200 Blackwell con comunicación rápida de chip a chip (NVLink-C2C) .
| NVIDIA GB200 Grace Blackwell Superchips conectados | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12,000 | 6 | 2,000 | 4 | 744 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de
las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de red,
consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el
almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.
Serie A4
Si tu objetivo es entrenar modelos de base de vanguardia que requieran una escala de procesamiento paralelo masiva, usa la serie de máquinas A4 para optimizar el tiempo de procesamiento y maximizar el rendimiento del hardware.
Los tipos de máquinas A4
tienen
GPU NVIDIA B200 Blackwell
(nvidia-b200) conectadas y son ideales para el entrenamiento y la entrega de modelos de base.
| GPU NVIDIA B200 Blackwell conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3,968 | 12,000 | 10 | 3,600 | 8 | 1,440 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de
las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de red, consulta
Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el
almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.
Serie A3 (Ultra, Mega y High con 8 GPU)
Si necesitas ejecutar ejecuciones de entrenamiento distribuido a gran escala o entregar modelos de vanguardia en varios hosts con tablas de conjuntos de datos grandes, usa la serie de máquinas A3 para minimizar la latencia de red de host a host.
A3 Ultra
| GPU NVIDIA H200 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2,952 | 12,000 | 10 | 3,600 | 8 | 1128 |
A3 Mega
| GPU NVIDIA H100 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3) |
a3-megagpu-8g |
208 | 1,872 | 6,000 | 9 | 1,800 | 8 | 640 |
A3 High
| GPU NVIDIA H100 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de
las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de red,
consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el
almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado de forma específica para manejar las demandas más altas de ancho de banda de tus cargas de trabajo de alto contenido gráfico.
Adquisición de capacidad
La adquisición de capacidad de procesamiento para las GPU en clústeres requiere coordinación para administrar la oferta y la demanda de aceleradores de alto rendimiento. Debido a que estos recursos se encuentran físicamente dentro de estructuras de redes especializadas, debes solicitarlos a través de flujos de trabajo administrados.
Puedes reservar capacidad a través de tu equipo de cuentas o usar reservas futuras y Dynamic Workload Scheduler.
¿Qué sigue?
- Para obtener información sobre cómo adquirir capacidad, consulta Opciones de consumo.
- Para evaluar los requisitos de tu infraestructura, consulta Elige una infraestructura.
- Para planificar la topología de tu red, consulta Requisitos de redes de GPU para entornos en clústeres.
- Para reservar recursos de procesamiento, consulta Reserva capacidad.