Las unidades de procesamiento gráfico (GPU) son aceleradores de hardware especializados diseñados para procesar cargas de trabajo masivamente paralelas de forma simultánea. EnGoogle Cloud, puedes conectar GPUs de NVIDIA a instancias de Compute Engine y a instancias de metal desnudo para acelerar cargas de trabajo exigentes, como el entrenamiento de inteligencia artificial (IA) y aprendizaje automático (AA), la computación de alto rendimiento (HPC), la renderización de gráficos y la transcodificación de video.
En este documento, se proporciona una descripción general de las GPUs en Google Cloud, incluidos los modelos de GPU disponibles, las asignaciones de series de máquinas, las características de rendimiento, los casos de uso ideales y las consideraciones sobre los precios.
¿Qué es una GPU?
Una GPU es un procesador masivamente paralelo que se diseñó originalmente para gráficos por computadora y evolucionó hasta convertirse en un motor de procesamiento esencial para la IA, el AA y la computación científica. A diferencia de las unidades centrales de procesamiento (CPU), que contienen unos pocos núcleos potentes optimizados para el procesamiento secuencial de un solo subproceso, las GPU constan de miles de núcleos más pequeños y altamente eficientes diseñados para realizar cálculos matemáticos de forma simultánea en grandes conjuntos de datos.
Los componentes arquitectónicos clave de un sistema de GPU son los siguientes:
Núcleos CUDA: Son unidades de procesamiento vectorial de uso general que ejecutan instrucciones en varios subprocesos paralelos de forma simultánea con una arquitectura de instrucción única y varios subprocesos (SIMT). Los núcleos CUDA controlan los cálculos estándar de vectores y de punto flotante (como FP32 y FP64), así como la renderización de gráficos generales y las simulaciones físicas.
Tensor Cores: Son unidades de procesamiento especializadas de multiplicación y acumulación de matrices (MMA) diseñadas para acelerar los cálculos de redes neuronales. Los Tensor Cores ofrecen aceleraciones exponenciales para el entrenamiento y la inferencia de la IA en formatos de precisión numérica especializados, incluidos FP4, FP8, INT8, TF32 y FP16/BF16.
Memoria de alto ancho de banda: Es una memoria dedicada integrado en el dispositivo que ofrece hasta varios terabytes por segundo (TBps) de ancho de banda, como la memoria de alto ancho de banda (HBM) o la memoria de doble velocidad de datos de gráficos (GDDR). Esta alta capacidad de procesamiento mantiene miles de núcleos de GPU suministrados con datos durante las operaciones de matrices intensivas.
Interconexiones de alta velocidad (NVLink y NVSwitch): Tecnologías de interconexión de alto ancho de banda y baja latencia que conectan varias GPUs en el mismo servidor o en diferentes nodos. NVLink proporciona comunicación directa entre GPU, lo que evita el bus PCIe más lento y permite que los clústeres de GPU funcionen como un solo grupo de memoria de acelerador coherente.
Software de estación de trabajo virtual (NVIDIA RTX vWS): Software empresarial que proporciona aceleración de gráficos virtualizados para estaciones de trabajo visuales remotas, diseño asistido por computadora (CAD), creación de contenido digital y modelado 3D.
Modelos de GPU y series de máquinas
Google Cloud ofrece GPU de NVIDIA de varias generaciones para satisfacer diferentes necesidades de presupuesto y cargas de trabajo. En Compute Engine, las GPUs están disponibles como series de máquinas optimizadas para aceleradores preconfiguradas (series A y G) o como aceleradores adjuntables en series de máquinas N1 de uso general.
En la siguiente tabla, se resumen las especificaciones de hardware, las asignaciones de series de máquinas, el ancho de banda de redes y las capacidades de almacenamiento de los modelos de GPU disponibles en Compute Engine:
| Modelo de GPU | Series de máquinas | Arquitectura | Memoria y ancho de banda de la GPU | GPUs por instancia de procesamiento | Ancho de banda máximo de red | SSD local | Interconexión | Compatibilidad con la estación de trabajo virtual (vWS) NVIDIA RTX |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | HBM3e de 279 GB (8 TBps) | 4 (NVL72) | 3,600 Gbps | 12,000 GiB | Malla completa de NVLink (1,800 GBps) | No |
| NVIDIA GB200 | A4X | Blackwell | HBM3e de 186 GB (8 TBps) | 4 (NVL72) | 2,000 Gbps | 12,000 GiB | Malla completa de NVLink (1,800 GBps) | No |
| NVIDIA B200 | A4 | Blackwell | HBM3e de 180 GB (8 TBps) | 8 | 3,600 Gbps | 12,000 GiB | Malla completa de NVLink (1,800 GBps) | No |
| NVIDIA H200 | A3 Ultra | Tolva | HBM3e de 141 GB (4.8 TBps) | 8 | 3,600 Gbps | 12,000 GiB | Malla completa de NVLink (900 GBps) | No |
| NVIDIA H100 | A3 Mega, High y Edge | Tolva | HBM3 de 80 GB (3.35 TBps) | 1, 2, 4, 8 | Hasta 1,000 Gbps | Hasta 6,000 GiB | Malla completa de NVLink (900 GBps) | No |
| NVIDIA A100 (80 GB) | A2 ultra | Ampere | HBM2e de 80 GB (1.9 TB/s) | 1, 2, 4, 8 | 100 Gbps | Hasta 3,000 GiB | Malla completa de NVLink (600 GBps) | No |
| NVIDIA A100 (40 GB) | A2 Estándar | Ampere | HBM2 de 40 GB (1.6 TB/s) | 1, 2, 4, 8, 16 | 100 Gbps | Hasta 3,000 GiB | Malla completa de NVLink (600 GBps) | No |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96 GB GDDR7 (1.597 TBps) | 1/8, 1/4, 1/2, 1, 2, 4, 8 | 200 Gbps | Hasta 3,000 GiB | PCIe Gen 5 | Sí |
| NVIDIA L4 | G2 | Ada Lovelace | GDDR6 de 24 GB (300 GB/s) | 1, 2, 4, 8 | 100 Gbps | Hasta 3,000 GiB | PCIe Gen 4 | Sí |
| NVIDIA T4 (Fin de la asistencia próximo) |
N1+T4 | Turing | GDDR6 de 16 GB (320 GB/s) | 1, 2, 4 | 100 Gbps | Admitido | PCIe Gen 3 | Sí |
| NVIDIA V100 | N1+V100 | Volta | HBM2 de 16 GB (900 GBps) | 1, 2, 4, 8 | 100 Gbps | Admitido | Anillo de NVLink (300 GBps) | No |
| NVIDIA P100 (Fin de la asistencia próximo) |
N1+P100 | Pascal | HBM2 de 16 GB (732 GBps) | 1, 2, 4 | 100 Gbps | Admitido | PCIe Gen 3 | Sí |
| NVIDIA P4 (Fin de la asistencia próximo) |
N1+P4 | Pascal | GDDR5 de 8 GB (192 GB/s) | 1, 2, 4 | 100 Gbps | Admitido | PCIe Gen 3 | Sí |
Características de rendimiento de la GPU
Elegir el modelo de GPU adecuado depende de las características de procesamiento, los requisitos de memoria, los formatos de precisión y las necesidades de escalabilidad de tu carga de trabajo.
Casos de uso ideales y requisitos de carga de trabajo
Las GPUs aceleran diversas cargas de trabajo computacionales en la IA, la computación visual y el modelado científico. Para comprender los requisitos de arquitectura de cada categoría de carga de trabajo, selecciona una de las siguientes pestañas:
Entrenamiento de IA/AA
Modelos básicos de Frontier y mezcla de expertos (MoE): El entrenamiento previo de modelos Transformer masivos, arquitecturas multimodales y redes de mezcla de expertos (MoE) requiere un alto rendimiento de los Tensor Cores, grandes capacidades de memoria de gran ancho de banda (HBM) (hasta 279 GB por GPU) y un ancho de banda de interconexión NVLink de velocidad ultrarrápida (hasta 1,800 GBps) para minimizar la latencia de sincronización de varios nodos. Serie de máquinas recomendada:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
Para obtener más información, consulta Recomendaciones para el entrenamiento previo de modelos en la documentación de AI Hypercomputer.
Ajuste y entrenamiento moderado de modelos: Adaptar modelos básicos existentes con técnicas como el ajuste eficiente de parámetros (PEFT) y la adaptación de bajo rango (LoRA) requiere suficiente memoria de GPU para contener los pesos y los gradientes del modelo sin necesidad de un clúster de varios nodos a escala de exaescala. Serie de máquinas recomendada:
Para obtener más información, consulta Recomendaciones para ajustar modelos en la documentación de AI Hypercomputer.
Inferencia de IA/AA
Inferencia de modelos grandes (más de 70,000 millones de parámetros): La entrega de modelos de lenguaje grandes (LLM) masivos se beneficia de la alta capacidad de la memoria de alto ancho de banda (HBM3e) (de 141 a 186 GB por GPU) para ajustar los pesos del modelo en menos GPUs, lo que reduce la sobrecarga de comunicación entre chips. Serie de máquinas recomendada:
Publicación de alto rendimiento y en tiempo real: Las consultas interactivas de baja latencia, las respuestas de transmisión y la generación de imágenes usan formatos numéricos cuantificados acelerados por hardware, como punto flotante de 8 bits (FP8), número entero de 8 bits (INT8) y número entero de 4 bits (INT4), para maximizar la capacidad de procesamiento de solicitudes por dólar. Serie de máquinas recomendada:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge y High (NVIDIA H100)
Para obtener más información, consulta Recomendaciones para la inferencia de servicio en la documentación de AI Hypercomputer.
Gráficos y computación visual
CAD en 3D, gemelos digitales y estaciones de trabajo virtuales: El modelado interactivo en 3D, el diseño asistido por computadora (CAD), la renderización arquitectónica y los gemelos digitales (como NVIDIA Omniverse) usan núcleos de trazado de rayos (RT) dedicados y estaciones de trabajo virtuales (vWS) NVIDIA RTX para estaciones de trabajo visuales remotas y GPU virtuales (vGPU) fraccionarias. Serie de máquinas recomendada:
Procesamiento y transcodificación de video: Las canalizaciones de transmisión en vivo, la transcodificación de video y el procesamiento de medios usan hardware dedicado NVIDIA Encoder (NVENC) y motores de video NVIDIA Decoder (NVDEC) que admiten los códecs AV1, High Efficiency Video Coding (HEVC) y H.264. Serie de máquinas recomendada:
HPC y simulación
Simulación y modelado científicos: Las aplicaciones en dinámica molecular (como GROMACS y AMBER), dinámica de fluidos computacional (CFD), química cuántica, astrofísica y previsión meteorológica requieren un alto rendimiento de punto flotante de doble precisión (FP64) de 64 bits y un alto ancho de banda de memoria. Serie de máquinas recomendada:
Para obtener más información, consulta Recomendaciones para HPC en la documentación de AI Hypercomputer.
Consideraciones sobre la carga de trabajo
Por lo general, las GPU no son adecuadas para las siguientes cargas de trabajo:
- Lógica secuencial y de un solo subproceso: Las tareas dominadas por ramas de decisión secuenciales o canalizaciones de ejecución en serie se ejecutan mejor en CPUs con frecuencias de reloj de un solo núcleo altas.
- Aplicaciones web y microservicios estándar: Los servidores web de uso general, los sistemas de administración de base de datos relacional (RDBMS) y los backends de API estándar sin requisitos de procesamiento de gráficos o IA no se benefician de la aceleración de la GPU. Estas cargas de trabajo se alojan de manera más rentable en instancias de CPU de uso general o optimizadas para procesamiento.
- Cargas de trabajo optimizadas para XLA y frameworks compilados en grafos: Si tus modelos de aprendizaje profundo se compilan con frameworks como JAX, PyTorch/XLA o TensorFlow, pueden aprovechar las optimizaciones de grafos controladas por el compilador (XLA). Si tus modelos también se benefician de los arrays sistólicos de matriz personalizados y la conmutación de circuitos ópticos, considera evaluar arquitecturas de aceleradores alternativas diseñadas para esos paradigmas de ejecución específicos.
Consideraciones sobre el precio
Los siguientes factores determinan los precios de las GPUs en Google Cloud:
Es el modelo de GPU específico.
Es la cantidad de GPUs conectadas.
Recursos aprovisionados, como CPU virtuales, memoria del sistema y almacenamiento
Es el modelo de consumo que seleccionas.
En las siguientes secciones, se describen los modelos de consumo y las opciones de descuento disponibles para las GPUs en Google Cloud.
Modelos de compra y consumo
Puedes aprovisionar instancias de GPU con varias opciones de consumo según tus requisitos de disponibilidad y tolerancia al costo:
A pedido: Precios estándar de pago por uso (PAYG) facturados por segundo sin compromiso a largo plazo. Las instancias a pedido ofrecen flexibilidad completa del ciclo de vida para el desarrollo, las pruebas y las cargas de trabajo de producción variables.
VMs Spot: Instancias de procesamiento con grandes descuentos (hasta un 60 a un 91% de descuento en las tarifas según demanda) que utilizan la capacidad excedente deGoogle Cloud . Debido a que Google Cloud puede detener o borrar VMs Spot para recuperar capacidad con un aviso de 30 segundos, estas instancias de procesamiento son ideales para el entrenamiento por lotes de AA tolerante a errores, los trabajos por lotes con puntos de control y el procesamiento de datos distribuido.
VMs de inicio flexible: Opción de programación dinámica con la tecnología del programador dinámico de cargas de trabajo (DWS) que aprovisiona recursos de GPU dentro de un período especificado para cargas de trabajo de duración fija (hasta 7 días) a tarifas con descuento.
Reservas:
- Reservas: Puedes reservar capacidad para GPUs estándar y usarla de inmediato.
- Reservas futuras (modo de calendario y AI Hypercomputer): Puedes solicitar reservar capacidad de GPU agrupadas para una fecha y hora futuras. Si Google Cloud aprueba tu solicitud, podrás comenzar a usar la capacidad en el horario especificado y conservar el acceso exclusivo hasta que finalice la reserva.
Opciones de descuento
Descuentos por compromiso de uso (CUD): Proporcionan descuentos sustanciales (hasta un 55% para compromisos de 3 años o un 37% para compromisos de 1 año) a cambio de un compromiso para mantener un nivel continuo de uso de recursos en una región específica. En el caso de los tipos de máquinas optimizados para aceleradores y las GPUs conectadas, los CUDs requieren la compra de compromisos basados en recursos adjuntos a reservas.
Descuentos por uso continuo (SUD): Descuentos automáticos que se aplican a las instancias de procesamiento N1 y a las GPUs conectadas cuando se ejecutan durante más del 25% de un mes de facturación. Las series de máquinas optimizadas para aceleradores (series A y G) no reciben SUD.
Para obtener información detallada sobre los precios por hora y por mes en todas las regiones, consulta la página de precios de GPU y la página de precios de instancias de VM.
Para obtener una matriz detallada de las funciones con la disponibilidad de las opciones de consumo en todos los tipos de máquinas con aceleradores, consulta Disponibilidad de las opciones de consumo por tipo de máquina.
¿Qué sigue?
- Explora las máquinas con GPU en la familia de máquinas optimizadas para aceleradores.
- Aprende a crear una VM con GPU conectadas.
- Descubre la arquitectura de supercomputación de IA de Google Clouden la descripción general de AI Hypercomputer.