Las GPUs generales están optimizadas para cargas de trabajo de Inteligencia Artificial (IA) y aprendizaje automático (AA) que priorizan la flexibilidad operativa, la independencia de recursos y la rentabilidad.
Las GPUs generales permiten que los equipos implementen y escalen aceleradores de NVIDIA con total autonomía operativa, lo que evita la complejidad arquitectónica de los clústeres de supercomputación coordinados. Son ideales para cargas de trabajo que priorizan la alta disponibilidad, el aprovisionamiento de autoservicio y el ajuste de escala independiente. Los casos de uso comunes incluyen la inferencia en tiempo real, el RAG, el prototipado y el entrenamiento de modelos pequeños a medianos.
Características clave de las GPUs generales
- Flexibilidad operativa: Puedes administrar recursos con las interfaces estándar de GKE (Autopilot y Estándar) y Compute Engine para simplificar la implementación y el ajuste de escala.
- Alta disponibilidad: Google Cloud Actualiza instancias individuales de forma independiente para garantizar que las actualizaciones en un nodo no afecten la disponibilidad de otros, lo que permite que tu balanceador de cargas redireccione el tráfico sin detener las flotas de servicio.
- Simplicidad de las redes: Tus cargas de trabajo usan servicios estándar de nube privada virtual (VPC) y TCP/IP estándar a través de interfaces de NIC virtual de Google (gVNIC) para eliminar estructuras complejas a nivel del hardware.
- Optimización de costos: Puedes usar VMs Spot para investigaciones tolerantes a errores y lograr ahorros de costos de hasta un 90% en comparación con las tarifas estándar bajo demanda.
- Adquisición de autoservicio: Puedes obtener capacidad directamente a través de reservas estándar y solicitudes a pedido sin necesidad de flujos de trabajo administrados por el equipo de cuentas.
Familias de GPU generales y especificaciones técnicas
Revisa las cargas de trabajo y las especificaciones de hardware para la serie de máquinas con GPU generales. Para la publicación con alta capacidad de procesamiento, usa la serie A3 Edge.
Serie A3 (High con 1, 2 o 4 GPUs y Edge)
A3 High (1, 2 o 4 GPUs)
Si ejecutas cargas de trabajo de inferencia o entrenamiento estándar que requieren un alto rendimiento, pero no necesitan un clúster sincronizado completo de 8 GPUs, usa la serie de máquinas A3 High con 1, 2 o 4 GPUs conectadas.
Los tipos de máquinas A3 High tienen GPUs NVIDIA H100 SXM y son adecuados para la inferencia de modelos grandes y el ajuste de modelos.
| GPU NVIDIA H100 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.
A3, Edge
Si ejecutas cargas de trabajo de inferencia distribuidas de alto rendimiento en varios hosts sin una estructura de clúster coordinada, usa la serie A3 Edge para simplificar la implementación en redes privadas virtuales estándar.
Los tipos de máquinas A3 Edge tienen GPUs NVIDIA H100 SXM y están diseñados específicamente para la entrega, además de estar disponibles en un conjunto limitado de regiones.
| GPU NVIDIA H100 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM3) |
a3-edgegpu-8g |
208 | 1,872 | 6,000 | 5 |
|
8 | 640 |
Serie A2 (estándar y ultra)
Si necesitas realizar la entrega de modelos de alto rendimiento en un solo nodo o el ajuste de modelos a pequeña escala, usa la serie de máquinas A2 para acceder a recursos de GPU NVIDIA A100 dedicados.
A2 ultra
| GPU NVIDIA A100 de 80 GB conectadas | ||||||
|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | SSD local conectado (GiB) | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM2e) |
a2-ultragpu-1g |
12 | 170 | 375 | 24 | 1 | 80 |
a2-ultragpu-2g |
24 | 340 | 750 | 32 | 2 | 160 |
a2-ultragpu-4g |
48 | 680 | 1,500 | 50 | 4 | 320 |
a2-ultragpu-8g |
96 | 1,360 | 3,000 | 100 | 8 | 640 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.
A2 Estándar
| GPUs NVIDIA A100 de 40 GB conectadas | ||||||
|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | Compatible con SSD local | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB HBM2) |
a2-highgpu-1g |
12 | 85 | Sí | 24 | 1 | 40 |
a2-highgpu-2g |
24 | 170 | Sí | 32 | 2 | 80 |
a2-highgpu-4g |
48 | 340 | Sí | 50 | 4 | 160 |
a2-highgpu-8g |
96 | 680 | Sí | 100 | 8 | 320 |
a2-megagpu-16g |
96 | 1,360 | Sí | 100 | 16 | 640 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.
Serie G4
Si tu equipo requiere inferencia de nivel básico rentable o cargas de trabajo de renderización de gráficos estándar, usa la serie de máquinas G4 con GPUs NVIDIA RTX PRO 6000.
Los tipos de máquinas G4 utilizan
GPUs NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000) y son adecuados para cargas de trabajo de simulación de NVIDIA Omniverse, aplicaciones con uso intensivo de gráficos, transcodificación de video y escritorios virtuales. Los tipos de máquinas G4 también proporcionan una solución de bajo costo para realizar la inferencia de un solo host y el ajuste del modelo en comparación con los tipos de máquinas de la serie A.
| GPUs NVIDIA RTX PRO 6000 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de la instancia (GB) | Máximo de SSD de Titanium admitido (GiB)2 | Cantidad de NICs físicas | Ancho de banda de red máximo (Gbps)3 | Recuento de GPU | Memoria de GPU4 (GB GDDR7) |
g4-standard-6 |
6 | 22 | 0 | 1 | 20 | 1/8 | 12 |
g4-standard-12 |
12 | 45 | 375 | 1 | 20 | 1/4 | 24 |
g4-standard-24 |
24 | 90 | 750 | 1 | 20 | 1/2 | 48 |
g4-standard-48 |
48 | 180 | 1,500 | 1 | 50 | 1 | 96 |
g4-standard-96 |
96 | 360 | 3,000 | 1 | 100 | 2 | 192 |
g4-standard-192 |
192 | 720 | 6,000 | 1 | 200 | 4 | 384 |
g4-standard-384 |
384 | 1,440 | 12,000 | 2 | 400 | 8 | 768 |
*La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo aceleradas, como las cargas de trabajo de aprendizaje automático y de alto contenido gráfico.
Serie G2
Si implementas aplicaciones de inferencia en tiempo real convencionales o canalizaciones de generación aumentada por recuperación (RAG), usa la serie de máquinas G2 para equilibrar el rendimiento y la eficiencia en cuanto a costos con las GPU NVIDIA L4.
| GPU NVIDIA L4 conectadas | |||||||
|---|---|---|---|---|---|---|---|
| Tipo de máquina | Recuento de CPU virtuales1 | Memoria de instancia predeterminada (GB) | Rango de memoria de instancia personalizado (GB) | Máximo de SSD local admitido (GiB) | Ancho de banda de red máximo (Gbps)2 | Recuento de GPU | Memoria de GPU3 (GB GDDR6) |
g2-standard-4 |
4 | 16 | De 16 a 32 | 375 | 10 | 1 | 24 |
g2-standard-8 |
8 | 32 | De 32 a 54 | 375 | 16 | 1 | 24 |
g2-standard-12 |
12 | 48 | De 48 a 54 | 375 | 16 | 1 | 24 |
g2-standard-16 |
16 | 64 | De 54 a 64 | 375 | 32 | 1 | 24 |
g2-standard-24 |
24 | 96 | De 96 a 108 | 750 | 32 | 2 | 48 |
g2-standard-32 |
32 | 128 | De 96 a 128 | 375 | 32 | 1 | 24 |
g2-standard-48 |
48 | 192 | De 192 a 216 | 1,500 | 50 | 4 | 96 |
g2-standard-96 |
96 | 384 | De 384 a 432 | 3,000 | 100 | 8 | 192 |
1 Una CPU virtual se implementa como un solo hipersubproceso de hardware en una de las plataformas de CPU disponibles.
2El ancho de banda de salida máximo no puede ser superior al número especificado. El ancho de banda de salida real depende de la dirección IP de destino y de otros factores.
Para obtener más información sobre el ancho de banda de la red, consulta Ancho de banda de red.
3La memoria de GPU es la memoria disponible en un dispositivo GPU que se puede usar para el almacenamiento temporal de datos. Es independiente de la memoria de la instancia y está diseñado específicamente para manejar las demandas de ancho de banda más altas de tus cargas de trabajo de alto contenido gráfico.
Serie N1 (NVIDIA T4 o V100)
Si tu prioridad es la experimentación sensible a los costos o la ejecución de inferencias de nivel básico con baja simultaneidad, usa la serie de máquinas N1 para conectar GPUs NVIDIA T4 o V100.
NVIDIA T4
| Tipo de acelerador | Recuento de GPU | Memoria de GPU1 (GB GDDR6) | Recuento de CPU virtuales | Memoria de la instancia (GB) | Compatible con SSD local |
|---|---|---|---|---|---|
nvidia-tesla-t4 o nvidia-tesla-t4-vws
|
1 | 16 | De 1 a 48 | De 1 a 312 | Sí |
| 2 | 32 | De 1 a 48 | De 1 a 312 | Sí | |
| 4 | 64 | De 1 a 96 | De 1 a 624 | Sí |
NVIDIA V100
| Tipo de acelerador | Recuento de GPU | Memoria de GPU1 (GB HBM2) | Recuento de CPU virtuales | Memoria de la instancia (GB) | Compatible con SSD local2 |
|---|---|---|---|---|---|
nvidia-tesla-v100 |
1 | 16 | De 1 a 12 | De 1 a 78 | Sí |
| 2 | 32 | De 1 a 24 | De 1 a 156 | Sí | |
| 4 | 64 | De 1 a 48 | De 1 a 312 | Sí | |
| 8 | 128 | De 1 a 96 | De 1 a 624 | Sí |
Adquisición de capacidad
Los aceleradores de GPU generales usan el aprovisionamiento estándar de autoservicio. Puedes obtener capacidad a través de reservas estándar, solicitudes según demanda o VMs Spot. Dado que la capacidad a pedido puede agotarse, usa VMs Spot o de inicio flexible siempre que sea posible.
¿Qué sigue?
- Para obtener información sobre cómo adquirir capacidad, consulta Opciones de consumo.
- Para evaluar tus requisitos de infraestructura, consulta Elige una infraestructura.
- Para revisar los servicios de redes para GPUs, consulta la descripción general de las redes de GPU.
- Para revisar el proceso y las decisiones que debes tomar cuando inicias un clúster, consulta Planifica y crea tu infraestructura de IA.