Descripción general de las GPUs

Las GPUs generales están optimizadas para cargas de trabajo de Inteligencia Artificial (IA) y aprendizaje automático (AA) que priorizan la flexibilidad operativa, la independencia de recursos y la rentabilidad.

Las GPUs generales permiten que los equipos implementen y escalen aceleradores de NVIDIA con total autonomía operativa, lo que evita la complejidad arquitectónica de los clústeres de supercomputación coordinados. Son ideales para cargas de trabajo que priorizan la alta disponibilidad, el aprovisionamiento de autoservicio y el ajuste de escala independiente. Los casos de uso comunes incluyen la inferencia en tiempo real, el RAG, el prototipado y el entrenamiento de modelos pequeños a medianos.

Características clave de las GPUs generales

  • Flexibilidad operativa: Puedes administrar recursos con las interfaces estándar de GKE (Autopilot y Estándar) y Compute Engine para simplificar la implementación y el ajuste de escala.
  • Alta disponibilidad: Google Cloud Actualiza instancias individuales de forma independiente para garantizar que las actualizaciones en un nodo no afecten la disponibilidad de otros, lo que permite que tu balanceador de cargas redireccione el tráfico sin detener las flotas de servicio.
  • Simplicidad de las redes: Tus cargas de trabajo usan servicios estándar de nube privada virtual (VPC) y TCP/IP estándar a través de interfaces de NIC virtual de Google (gVNIC) para eliminar estructuras complejas a nivel del hardware.
  • Optimización de costos: Puedes usar VMs Spot para investigaciones tolerantes a errores y lograr ahorros de costos de hasta un 90% en comparación con las tarifas estándar bajo demanda.
  • Adquisición de autoservicio: Puedes obtener capacidad directamente a través de reservas estándar y solicitudes a pedido sin necesidad de flujos de trabajo administrados por el equipo de cuentas.

Familias de GPU generales y especificaciones técnicas

Revisa las cargas de trabajo y las especificaciones de hardware para la serie de máquinas con GPU generales. Para la publicación con alta capacidad de procesamiento, usa la serie A3 Edge.

Serie A3 (High con 1, 2 o 4 GPUs y Edge)

A3 High (1, 2 o 4 GPUs)

Si ejecutas cargas de trabajo de inferencia o entrenamiento estándar que requieren un alto rendimiento, pero no necesitan un clúster sincronizado completo de 8 GPUs, usa la serie de máquinas A3 High con 1, 2 o 4 GPUs conectadas.

Los tipos de máquinas A3 High tienen GPUs NVIDIA H100 SXM y son adecuados para la inferencia de modelos grandes y el ajuste de modelos.

GPU NVIDIA H100 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1,500 1 50 2 160
a3-highgpu-4g 104 936 3,000 1 100 4 320
a3-highgpu-8g 208 1,872 6,000 5 1,000 8 640

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.

A3, Edge

Si ejecutas cargas de trabajo de inferencia distribuidas de alto rendimiento en varios hosts sin una estructura de clúster coordinada, usa la serie A3 Edge para simplificar la implementación en redes privadas virtuales estándar.

Los tipos de máquinas A3 Edge tienen GPUs NVIDIA H100 SXM y están diseñados específicamente para la entrega, además de estar disponibles en un conjunto limitado de regiones.

GPU NVIDIA H100 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM3)
a3-edgegpu-8g 208 1,872 6,000 5
  • 600: para asia-south1 y northamerica-northeast2
  • 400: para todas las demás regiones de A3 Edge
8 640

Serie A2 (estándar y ultra)

Si necesitas realizar la entrega de modelos de alto rendimiento en un solo nodo o el ajuste de modelos a pequeña escala, usa la serie de máquinas A2 para acceder a recursos de GPU NVIDIA A100 dedicados.

A2 ultra

GPU NVIDIA A100 de 80 GB conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) SSD local conectado (GiB) Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1,500 50 4 320
a2-ultragpu-8g 96 1,360 3,000 100 8 640

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.

A2 Estándar

GPUs NVIDIA A100 de 40 GB conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) Compatible con SSD local Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3
(GB HBM2)
a2-highgpu-1g 12 85 24 1 40
a2-highgpu-2g 24 170 32 2 80
a2-highgpu-4g 48 340 50 4 160
a2-highgpu-8g 96 680 100 8 320
a2-megagpu-16g 96 1,360 100 16 640

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.

Serie G4

Si tu equipo requiere inferencia de nivel básico rentable o cargas de trabajo de renderización de gráficos estándar, usa la serie de máquinas G4 con GPUs NVIDIA RTX PRO 6000.

Los tipos de máquinas G4 utilizan GPUs NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000) y son adecuados para cargas de trabajo de simulación de NVIDIA Omniverse, aplicaciones con uso intensivo de gráficos, transcodificación de video y escritorios virtuales. Los tipos de máquinas G4 también proporcionan una solución de bajo costo para realizar la inferencia de un solo host y el ajuste del modelo en comparación con los tipos de máquinas de la serie A.

GPUs NVIDIA RTX PRO 6000 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de la instancia (GB) Máximo de SSD de Titanium admitido (GiB)2 Cantidad de NICs físicas Ancho de banda de red máximo (Gbps)3 Recuento de GPU Memoria de GPU4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1,500 1 50 1 96
g4-standard-96 96 360 3,000 1 100 2 192
g4-standard-192 192 720 6,000 1 200 4 384
g4-standard-384 384 1,440 12,000 2 400 8 768

*La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo aceleradas, como las cargas de trabajo de aprendizaje automático y de alto contenido gráfico.

Serie G2

Si implementas aplicaciones de inferencia en tiempo real convencionales o canalizaciones de generación aumentada por recuperación (RAG), usa la serie de máquinas G2 para equilibrar el rendimiento y la eficiencia en cuanto a costos con las GPU NVIDIA L4.

GPU NVIDIA L4 conectadas
Tipo de máquina Recuento de CPU virtuales1 Memoria de instancia predeterminada (GB) Rango de memoria de instancia personalizado (GB) Máximo de SSD local admitido (GiB) Ancho de banda de red máximo (Gbps)2 Recuento de GPU Memoria de GPU3 (GB GDDR6)
g2-standard-4 4 16 De 16 a 32 375 10 1 24
g2-standard-8 8 32 De 32 a 54 375 16 1 24
g2-standard-12 12 48 De 48 a 54 375 16 1 24
g2-standard-16 16 64 De 54 a 64 375 32 1 24
g2-standard-24 24 96 De 96 a 108 750 32 2 48
g2-standard-32 32 128 De 96 a 128 375 32 1 24
g2-standard-48 48 192 De 192 a 216 1,500 50 4 96
g2-standard-96 96 384 De 384 a 432 3,000 100 8 192

1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores. Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.

Serie N1 (NVIDIA T4 o V100)

Si tu prioridad es la experimentación sensible a los costos o la ejecución de inferencias de nivel básico con baja simultaneidad, usa la serie de máquinas N1 para conectar GPUs NVIDIA T4 o V100.

NVIDIA T4

Tipo de acelerador Recuento de GPU Memoria de GPU1 (GB GDDR6) Recuento de CPU virtuales Memoria de la instancia (GB) Compatible con SSD local
nvidia-tesla-t4 o
nvidia-tesla-t4-vws
1 16 De 1 a 48 De 1 a 312
2 32 De 1 a 48 De 1 a 312
4 64 De 1 a 96 De 1 a 624

NVIDIA V100

Tipo de acelerador Recuento de GPU Memoria de GPU1 (GB HBM2) Recuento de CPU virtuales Memoria de la instancia (GB) Compatible con SSD local2
nvidia-tesla-v100 1 16 De 1 a 12 De 1 a 78
2 32 De 1 a 24 De 1 a 156
4 64 De 1 a 48 De 1 a 312
8 128 De 1 a 96 De 1 a 624

Adquisición de capacidad

Los aceleradores de GPU generales usan el aprovisionamiento estándar de autoservicio. Puedes obtener capacidad a través de reservas estándar, solicitudes según demanda o VMs Spot. Dado que la capacidad a pedido puede agotarse, usa VMs Spot o de inicio flexible siempre que sea posible.

¿Qué sigue?