AI Hypercomputer tiene varias opciones de consumo para adquirir recursos de procesamiento. Estas opciones abordan necesidades como la duración de la carga de trabajo, la tolerancia a fallas y el modelo de infraestructura. Obtén información sobre estas opciones y elige la mejor para tu caso de uso.
Descripción general de las opciones de consumo
Para comparar las opciones de consumo en función de las características clave, usa la siguiente tabla:
| Opción de consumo | Modelo de aprovisionamiento | Ideal para | Garantía de capacidad | Vida útil | Interrumpible | Quota | Descuentos | Modelo de asignación |
|---|---|---|---|---|---|---|---|---|
| Inicio flexible | Inicio flexible | Cargas de trabajo de corta duración (hasta siete días) que pueden esperar la capacidad | Mejor esfuerzo | Hasta siete días | No | Cuota interrumpible | Descuento (hasta un 53%) en las series compatibles | Dense para solicitudes de cambio de tamaño de MIG; mejor esfuerzo para VMs independientes |
| VMs Spot | Spot | Cargas de trabajo de GPU generales de corta duración y tolerantes a errores | Mejor esfuerzo | Interrumpible | Sí | Cuota interrumpible | Grandes descuentos (hasta un 91%) | Estándar |
| Reservas estándar | Estándar | Cargas de trabajo de GPU generales esenciales que requieren un nivel muy alto de garantía de capacidad | Muy alta | Muy alta | Definido por el usuario | No | No se consume cuota | Tarifas con descuento con descuentos por compromiso de uso (CUD) |
| Reservas futuras para bloques de capacidad | Con reserva | Entrenamiento a gran escala y de larga duración en GPU en clúster | Muy alta | Ilimitado dentro del período de reserva | No | Aumento automático | Descuento (hasta un 53%) con CUD | Dense |
| Reservas futuras en modo calendario | Con reserva | Cargas de trabajo de GPU en clúster de hasta 90 días que requieren capacidad reservada | Muy alta | Hasta 90 días | No | No se consume cuota | Descuento (hasta un 53%) | Dense |
| VM según demanda | Estándar | Cargas de trabajo de GPU generales sin una duración específica | Mejor esfuerzo | Ilimitado | No | Cuota a pedido | Ninguno (pago por uso) | Estándar |
La opción de consumo que usas para implementar tu infraestructura depende de si usas GPU generales o GPU en clúster.
GPU generales: Diseñadas para inferencia a pequeña escala , desarrollo y cargas de trabajo de entrenamiento a menor escala. Este tipo de GPU ofrece flexibilidad operativa a través del mantenimiento asíncrono. Para ver las opciones disponibles, consulta Opciones de consumo para GPU generales.
GPU en clúster: Diseñadas para cargas de trabajo de entrenamiento a gran escala y estrechamente acopladas, y cargas de trabajo de inferencia, RL y modelos de razonamiento a gran escala que requieren una alta garantía de capacidad y una asignación de recursos densa para minimizar la latencia de red. Para ver las opciones disponibles, consulta Opciones de consumo para GPU en clúster.
Opciones de consumo para GPU generales
Usa las siguientes opciones de consumo para adquirir capacidad para GPU generales.
Usar el inicio flexible
Para ejecutar cargas de trabajo de corta duración que requieren recursos asignados de forma densa, puedes solicitar recursos de procesamiento por hasta siete días con el inicio flexible. Cuando los recursos están disponibles, Compute Engine crea la cantidad solicitada de VMs. Puedes detener las VMs de inicio flexible independientes, pero no puedes detener las VMs de inicio flexible que crea un grupo de instancias administrado (MIG) a través de solicitudes de cambio de tamaño. Las VMs de inicio flexible existen hasta que las borras o hasta que Compute Engine las borra al final de su duración de ejecución.
Cargas de trabajo ideales
- Preentrenamiento de modelos pequeños
- Ajuste del modelo
- Simulación de computación de alto rendimiento (HPC)
- Inferencia por lotes
Características clave
- Modelo de aprovisionamiento: Inicio flexible
- Amplia compatibilidad con hardware: Solicita cualquier tipo de máquina de GPU en clúster, excepto A4X Max y A4X.
- Optimización de la latencia: Aplica una política de posición compacta a las VMs independientes para minimizar la latencia de red.
- Rentabilidad: Recibe un descuento de hasta un 53% en CPU virtuales, memoria, GPU, y discos SSD locales para las series de máquinas A4, A3, A2 y G4. Se aplican tarifas estándar según demanda a otras series compatibles. Para obtener más información, consulta Precios de inicio flexible.
Usar Spot
Para ejecutar cargas de trabajo tolerantes a errores, puedes obtener recursos de procesamiento de inmediato según la disponibilidad. Obtienes recursos al precio más bajo posible. Sin embargo, Compute Engine puede interrumpir las VMs en cualquier momento para recuperar capacidad.
Cargas de trabajo ideales
- Procesamiento por lotes y análisis de datos
- Computación de alto rendimiento (HPC) y codificación de medios
Características clave
- Modelo de aprovisionamiento: Spot.
- Amplia compatibilidad con hardware: Solicita cualquier tipo de máquina de GPU en clúster, excepto A4X Max y A4X.
- Optimización de la latencia: Aplica una política de posición compacta a las VMs independientes para minimizar la latencia de red.
- Rentabilidad: Recibe un descuento de hasta un 91% en CPU virtuales, memoria, GPU, y discos SSD locales.
Usar a pedido
Sugerencia: Para aumentar tus posibilidades de obtener capacidad de GPU generales, usa el inicio flexible o Spot. Estas opciones de consumo ofrecen GPU a un precio con descuento en comparación con los precios según demanda y se diseñaron para ayudarte a aumentar tus posibilidades de obtener recursos de alta demanda, como las GPU.
Para ejecutar cargas de trabajo sin una duración específica, puedes obtener recursos de procesamiento de inmediato según la disponibilidad. Las VMs se ejecutan hasta que las detienes o las borras.
Cargas de trabajo ideales
- Inferencia y entrega de modelos
- Creación de prototipos y experimentación
Características clave
- Modelo de aprovisionamiento: Estándar
- Disponibilidad inmediata: Crea instancias de VM de inmediato sin esperar la programación o la aprobación de la capacidad.
- Precios estándar: Paga los recursos a las tarifas estándar según demanda sin compromisos a largo plazo.
- Amplia compatibilidad con hardware: Úsalo con cualquier serie de máquinas de GPU compatible en la ruta de GPU generales.
Usar reservas estándar
Para ejecutar cargas de trabajo de GPU generales esenciales que requieren un nivel muy alto de garantía de capacidad, puedes usar reservas estándar.
Cargas de trabajo ideales
- Cargas de trabajo de producción esenciales
- Cargas de trabajo que requieren capacidad garantizada
Características clave
- Modelo de aprovisionamiento: Estándar
- Garantía de capacidad: Proporciona una garantía muy alta de que los recursos están disponibles.
- Precios: Se aplican tarifas estándar, pero puedes adjuntar CUD para obtener ahorros.
Opciones de consumo para GPU en clúster
Usa las siguientes opciones de consumo para adquirir capacidad para GPU en clúster.Usar reservas futuras para bloques de capacidad
Para ejecutar cargas de trabajo distribuidas a gran escala y de larga duración que requieren recursos asignados de forma densa, puedes solicitar recursos de procesamiento para un momento específico en el futuro. Tienes acceso exclusivo a los recursos reservados durante ese período y puedes usarlos para crear VMs o clústeres. Al final del período de reserva, Compute Engine hace lo siguiente:
- Compute Engine borra la reserva.
- Según la acción de finalización que especifiques para las VMs, Compute Engine detiene o borra cualquier VM que use la reserva.
Cargas de trabajo ideales
- Preentrenamiento de modelos de base
- Inferencia para modelos de base en varios hosts
Características clave
- Modelo de aprovisionamiento: Con reserva
- Compatibilidad con máquinas premium: Reserva tipos de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega o A3 High (8 GPUs).
- Requisitos de compromiso: Adjunta un compromiso basado en recursos para reservas de un año o más.
- Modificaciones dinámicas: Habilita las notificaciones de mantenimiento de emergencia de hardware para el uso de trabajos de Vertex AI después de que comience el período.
Usar reservas futuras en modo calendario
Para ejecutar cargas de trabajo distribuidas de corta duración que requieren recursos asignados de forma densa, puedes solicitar recursos de procesamiento por hasta 90 días. Tienes acceso exclusivo a los recursos reservados durante ese tiempo y puedes usarlos para crear VMs o clústeres. Al final del período de reserva, Compute Engine hace lo siguiente:
- Compute Engine borra la reserva.
- Según la acción de finalización que especifiques para las VMs, Compute Engine detiene o borra cualquier VM que use la reserva.
Cargas de trabajo ideales
- Preentrenamiento y ajuste
- Simulaciones e inferencia a gran escala
Características clave
- Modelo de aprovisionamiento: Con reserva
- Compatibilidad con series de máquinas: Reserva tipos de máquinas A4, A3 Ultra, A3 Mega o A3 High (8 GPUs)
- Límites de escalabilidad: Reserva hasta 80 VMs por un máximo de 90 días.
- Aprovisionamiento optimizado: Usa un modelo con reserva para aumentar tus posibilidades de obtener GPU.
Usar el inicio flexible
Usa el inicio flexible para las solicitudes de cambio de tamaño del grupo de instancias administrado (MIG) en clúster cuando necesites recursos asignados de forma densa por hasta siete días.
Cargas de trabajo ideales
Las VMs de inicio flexible son ideales para ejecutar cargas de trabajo que pueden iniciarse en cualquier momento, como las siguientes:
- Preentrenamiento de modelos pequeños
- Ajuste del modelo
- Simulación de computación de alto rendimiento (HPC)
- Inferencia por lotes
Características clave
- Modelo de aprovisionamiento: Inicio flexible
- Asignación de recursos: Asignación densa para solicitudes de cambio de tamaño de MIG
- Rentabilidad: Recibe un descuento de hasta un 53% en CPU virtuales, memoria, GPU, y cualquier disco SSD local conectado para las series de máquinas A4, A3, A2 y G4. Se aplican tarifas estándar según demanda a otras series compatibles.
Usar Spot
Puedes usar VMs Spot para cargas de trabajo tolerantes a errores asignadas de forma densa para obtener grandes descuentos, con el entendimiento de que Compute Engine puede interrumpir las VMs para recuperar capacidad.
Cargas de trabajo ideales
- Entrenamiento distribuido tolerante a errores
- Procesamiento por lotes
Características clave
- Modelo de aprovisionamiento: Spot.
- Interrupción: Compute Engine puede interrumpir las instancias en cualquier momento.
- Rentabilidad: Recibe un descuento de hasta un 91% en CPU virtuales, memoria, GPU, y cualquier disco SSD local conectado.
¿Qué sigue?
- Para identificar las necesidades de tu carga de trabajo, consulta Identifica las necesidades de tu carga de trabajo.
- Para crear y usar reservas, consulta Crea y usa reservas.
- Para obtener más información sobre las VMs Spot, consulta Más información sobre las VMs Spot.
- Para crear una instancia de VM a pedido, consulta Crea una instancia de VM a pedido.