Elige entre GPUs generales y GPUs agrupadas

En este documento, se proporcionan recomendaciones sobre los aceleradores, las opciones de consumo y las herramientas de implementación más adecuadas para diferentes cargas de trabajo de inteligencia artificial (IA), aprendizaje automático (AA) y computación de alto rendimiento (HPC). Usa este documento para identificar la mejor implementación para tu carga de trabajo.

Para obtener información y recomendaciones sobre los pilares de la infraestructura para las cargas de trabajo de IA, AA y HPC, consulta los siguientes documentos:

Descripción general de las cargas de trabajo

La arquitectura de AI Hypercomputer admite los siguientes casos de uso:

Carga de trabajo Descripción Recomendación
Preentrenamiento de modelos de base Esto implica crear un modelo de lenguaje con un conjunto de datos grande. El resultado del entrenamiento previo de los modelos de base es un nuevo modelo que es bueno para realizar tareas generales.
Los modelos se clasifican según su tamaño de la siguiente manera:
  • Modelo de frontera: Modelos de AA que abarcan cientos de miles de millones o billones de parámetros, o incluso más. Estos incluyen modelos de lenguaje grandes (LLM) como Gemini.
  • Modelo grande: Modelos de AA que abarcan desde decenas hasta cientos de miles de millones de parámetros o más.
Consulta las recomendaciones para modelos de entrenamiento previo
Ajuste Esto implica tomar un modelo entrenado y adaptarlo para realizar tareas específicas con conjuntos de datos especializados o con otras técnicas. Por lo general, el ajuste se realiza en modelos grandes. Consulta las recomendaciones para ajustar modelos
Inferencia o publicación Esto implica tomar un modelo entrenado o ajustado y ponerlo a disposición de los usuarios o las aplicaciones.
Las cargas de trabajo de inferencia se categorizan según el tamaño de los modelos de la siguiente manera:
  • Inferencia para modelos de base en varios hosts: Realiza la inferencia con modelos de AA entrenados que abarcan cientos de miles de millones hasta billones de parámetros o más. Para estas cargas de trabajo de inferencia, la carga computacional se comparte entre varias máquinas host.
  • Inferencia de modelos base en un solo host: Se realiza la inferencia con modelos de AA entrenados que abarcan decenas o cientos de miles de millones de parámetros. Para estas cargas de trabajo de inferencia, la carga computacional se limita a una sola máquina anfitrión.
  • Inferencia de modelos grandes: Realiza inferencias con modelos de AA entrenados o ajustados que abarcan decenas o cientos de miles de millones de parámetros.
Consulta las recomendaciones para la inferencia
AA para modelos pequeños o medianos Esto implica entrenar y entregar modelos de AA que son más pequeños en tamaño y complejidad, por lo general para tareas más especializadas. Consulta las recomendaciones de AA para modelos pequeños o medianos
HPC Esta es la práctica de agregar recursos de procesamiento para obtener un rendimiento mayor que el de solo una estación de trabajo, un servidor o una computadora. La HPC se usa para resolver problemas en la investigación académica, la ciencia, el diseño, la inteligencia empresarial y la simulación. Consulta las recomendaciones para la HPC

Recomendaciones para modelos de entrenamiento previo

Para entrenar previamente los modelos de base, los clústeres grandes de aceleradores leen continuamente grandes volúmenes de datos. Estos aceleradores ajustan los pesos a través de pases hacia adelante y hacia atrás para aprender de los datos. Estos trabajos de entrenamiento se ejecutan durante semanas o incluso meses.

En las siguientes secciones, se describen los aceleradores y las opciones de consumo que te recomendamos usar para entrenar previamente los modelos de base.

Aceleradores recomendados

Para preentrenar modelos de base en Google Cloud, te recomendamos que uses los tipos de máquinas optimizadas para aceleradores A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB) y que uses un orquestador para implementar el clúster.

Para implementar estos clústeres de aceleradores, también te recomendamos que uses Cluster Director o Cluster Toolkit. Para obtener más información, consulta la guía de implementación del clúster correspondiente al tipo de máquina que elijas en la siguiente tabla.

Cargas de trabajo Recomendaciones Guía de implementación de clústeres
Tipo de máquina Organizador
Preentrenar modelos de base
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Crea un clúster de GKE optimizado para IA con la configuración predeterminada
Slurm
Entrenamiento de modelos grandes A3 Ultra (NVIDIA H200 141 GB) GKE Crea un clúster de GKE optimizado para IA con la configuración predeterminada
Slurm
Entrenamiento de modelos grandes
  • A3 Mega (NVIDIA H100 de 80 GB)
  • A3 High (NVIDIA H100 80 GB)
GKE Maximiza el ancho de banda de red de la GPU en clústeres de modo Standard
Slurm

Opción de consumo recomendada

Para obtener un alto nivel de garantía en la obtención de grandes clústeres de aceleradores, te recomendamos que uses una reserva. Específicamente, para minimizar los costos de los recursos reservados, te recomendamos que solicites una duración de reserva lo suficientemente larga como para recibir descuentos por compromiso de uso. Para obtener más información sobre las opciones de consumo, consulta Elige una opción de consumo.

Recomendaciones para ajustar modelos

Para ajustar modelos de base grandes, los clústeres más pequeños de aceleradores leen volúmenes moderados de datos. Estos aceleradores ajustan el modelo para realizar tareas específicas. Estos trabajos de ajuste se ejecutan durante días o incluso semanas.

En las siguientes secciones, se describen los aceleradores y las opciones de consumo recomendados para usar cuando se ajustan modelos.

Para ajustar modelos en Google Cloud, te recomendamos que uses los tipos de máquinas optimizadas para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB) y que uses un orquestador para implementar el clúster.

Para implementar estos clústeres de aceleradores, también te recomendamos que uses Cluster Director o Cluster Toolkit. Para obtener más información, consulta la guía de implementación del clúster correspondiente al tipo de máquina que elijas en la siguiente tabla.

Cargas de trabajo Recomendaciones Guía de implementación de clústeres
Tipo de máquina Organizador
Ajuste de modelos grandes A3 Ultra (NVIDIA H200 141 GB) GKE Crea un clúster de GKE optimizado para IA con la configuración predeterminada
Slurm
Ajuste de modelos grandes
  • A3 Mega (NVIDIA H100 de 80 GB)
  • A3 High (NVIDIA H100 80 GB)
GKE Maximiza el ancho de banda de red de la GPU en clústeres del modo estándar
Slurm

Opción de consumo recomendada

Para las cargas de trabajo de ajuste, usa una reserva futura en el modo de calendario para aprovisionar recursos. Para obtener más información sobre las opciones de consumo, consulta Cómo elegir una opción de consumo.

Recomendaciones para la inferencia

En las siguientes secciones, se describen los aceleradores y las opciones de consumo recomendados para realizar la inferencia.

Aceleradores recomendados

Los aceleradores recomendados para la inferencia dependen de si realizas una inferencia de frontera de varios hosts o de modelos grandes, o bien una inferencia de frontera de un solo host.

Aceleradores recomendados (varios hosts)

Para realizar la inferencia de modelos grandes o de frontera de varios hosts en Google Cloud, usa los tipos de máquinas optimizadas para aceleradores A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB) y, luego, implementa la máquina con un orquestador. Para implementar estos clústeres de aceleradores, también te recomendamos que uses Cluster Director o Cluster Toolkit. En la tabla, se proporcionan vínculos a las guías de implementación de clústeres para cada tipo de máquina recomendado.

Cargas de trabajo Recomendaciones Guía de implementación de clústeres
Tipo de máquina Organizador
Inferencia de la frontera de varios hosts
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Crea un clúster de GKE optimizado para IA con la configuración predeterminada
Slurm
Inferencia de modelos grandes A3 Ultra (NVIDIA H200 141 GB) GKE Crea un clúster de GKE optimizado para IA con la configuración predeterminada
Slurm
Inferencia de modelos grandes
  • A3 Mega (NVIDIA H100 de 80 GB)
  • A3 High (NVIDIA H100 80 GB)
GKE Maximiza el ancho de banda de red de la GPU en clústeres del modo estándar
Slurm

Aceleradores recomendados (un solo host)

En la siguiente tabla, se describen los aceleradores que te recomendamos usar para realizar la inferencia de la frontera de un solo host. En la tabla, se proporcionan vínculos a las guías de implementación de VM para cada tipo de máquina recomendado.

Cargas de trabajo Recomendaciones Guía de implementación de la VM
Tipo de máquina Organizador
Inferencia de vanguardia y generalizada de un solo host
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141 GB)
N/A Crea una instancia de A4 o A3 Ultra
  • A3 High (NVIDIA H100 80 GB)
  • A3 Edge (NVIDIA H100 80 GB)
Crea una instancia de A3 High o A3 Edge
G4 (NVIDIA RTX PRO 6000) Crea una instancia de G4
A2 (NVIDIA A100) Crea una instancia de A2
G2 (NVIDIA L4) Crea una instancia de G2
N1 (NVIDIA T4 o V100) Crea una instancia N1

Opción de consumo recomendada

Para la inferencia, usa una reserva de larga duración o una reserva futura en modo de calendario. Para obtener más información sobre las opciones de consumo, consulta Cómo elegir una opción de consumo.

Recomendaciones para modelos pequeños o medianos

Para las cargas de trabajo de AA que involucran modelos de tamaño pequeño a mediano, lograr un equilibrio óptimo entre el precio y el rendimiento es una consideración principal.

Aceleradores recomendados

En la siguiente tabla, se describen los aceleradores recomendados para usar en cargas de trabajo de AA de modelos pequeños a medianos.

Cargas de trabajo Recomendaciones Guía de implementación de la VM
Tipo de máquina Organizador
AA para modelos pequeños o medianos G4 (NVIDIA RTX PRO 6000) N/A Crea una instancia de G4
G2 (NVIDIA L4) Crea una instancia de G2
A2 (NVIDIA A100) Crea una instancia de A2
A3 Edge (NVIDIA H100 80 GB) Crea una instancia de A3 Edge
N1 (NVIDIA T4 o V100) Crea una instancia N1

Recomendaciones para HPC

Para las cargas de trabajo de HPC, cualquier serie de máquinas optimizadas para aceleradores o serie de máquinas optimizadas para procesamiento funciona bien. Si usas una serie de máquinas optimizadas para aceleradores, la mejor opción depende de la cantidad de procesamiento que se debe transferir a la GPU. Para obtener una lista detallada de las recomendaciones para las cargas de trabajo de HPC, consulta Prácticas recomendadas para ejecutar cargas de trabajo de HPC.

Resumen de recomendaciones

En la siguiente tabla, se resumen los aceleradores y las opciones de consumo recomendados para cada carga de trabajo.

Recurso Recomendación
Preentrenamiento del modelo
Familia de máquinas Usa uno de los siguientes tipos de máquinas optimizadas para aceleradores: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB).
Opción de consumo "Usar reservas futuras estándar
Ajuste del modelo
Familia de máquinas Usa los tipos de máquinas optimizadas para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB).
Opción de consumo "Usar reservas futuras estándar
Inferencia
Familia de máquinas Usa uno de los siguientes tipos de máquinas: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB), A3 High (NVIDIA H100 de 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 de 80 GB) o N1 (NVIDIA T4 o V100).
Opción de consumo Usar reservas, instancias según demanda o Spot
AA para modelos pequeños o medianos
Familia de máquinas Usa uno de los siguientes tipos de máquinas: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 de 80 GB) o N1 (NVIDIA T4 o V100).
Opción de consumo Usar reservas estándar, de Spot o según demanda
Almacenamiento Usa Cloud Storage FUSE
HPC
Consulta la sección de resumen de las prácticas recomendadas para ejecutar cargas de trabajo de HPC

¿Qué sigue?