En este documento, se proporcionan recomendaciones sobre los aceleradores, las opciones de consumo y las herramientas de implementación más adecuadas para diferentes cargas de trabajo de inteligencia artificial (IA), aprendizaje automático (AA) y computación de alto rendimiento (HPC). Usa este documento para identificar la mejor implementación para tu carga de trabajo.
Para obtener información y recomendaciones sobre los pilares de la infraestructura para las cargas de trabajo de IA, AA y HPC, consulta los siguientes documentos:
- Acerca de los aceleradores de GPU
- Descripción general de la red de GPU
- Descripción general de los servicios de almacenamiento
Descripción general de las cargas de trabajo
La arquitectura de AI Hypercomputer admite los siguientes casos de uso:
| Carga de trabajo | Descripción | Recomendación |
|---|---|---|
| Preentrenamiento de modelos de base | Esto implica crear un modelo de lenguaje con un conjunto de datos grande. El resultado del entrenamiento previo de los modelos de base es un nuevo modelo que es bueno para realizar tareas generales. Los modelos se clasifican según su tamaño de la siguiente manera:
|
Consulta las recomendaciones para modelos de entrenamiento previo |
| Ajuste | Esto implica tomar un modelo entrenado y adaptarlo para realizar tareas específicas con conjuntos de datos especializados o con otras técnicas. Por lo general, el ajuste se realiza en modelos grandes. | Consulta las recomendaciones para ajustar modelos |
| Inferencia o publicación | Esto implica tomar un modelo entrenado o ajustado y ponerlo a disposición de los usuarios o las aplicaciones. Las cargas de trabajo de inferencia se categorizan según el tamaño de los modelos de la siguiente manera:
|
Consulta las recomendaciones para la inferencia |
| AA para modelos pequeños o medianos | Esto implica entrenar y entregar modelos de AA que son más pequeños en tamaño y complejidad, por lo general para tareas más especializadas. | Consulta las recomendaciones de AA para modelos pequeños o medianos |
| HPC | Esta es la práctica de agregar recursos de procesamiento para obtener un rendimiento mayor que el de solo una estación de trabajo, un servidor o una computadora. La HPC se usa para resolver problemas en la investigación académica, la ciencia, el diseño, la inteligencia empresarial y la simulación. | Consulta las recomendaciones para la HPC |
Recomendaciones para modelos de entrenamiento previo
Para entrenar previamente los modelos de base, los clústeres grandes de aceleradores leen continuamente grandes volúmenes de datos. Estos aceleradores ajustan los pesos a través de pases hacia adelante y hacia atrás para aprender de los datos. Estos trabajos de entrenamiento se ejecutan durante semanas o incluso meses.
En las siguientes secciones, se describen los aceleradores y las opciones de consumo que te recomendamos usar para entrenar previamente los modelos de base.
Aceleradores recomendados
Para preentrenar modelos de base en Google Cloud, te recomendamos que uses los tipos de máquinas optimizadas para aceleradores A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB) y que uses un orquestador para implementar el clúster.
Para implementar estos clústeres de aceleradores, también te recomendamos que uses Cluster Director o Cluster Toolkit. Para obtener más información, consulta la guía de implementación del clúster correspondiente al tipo de máquina que elijas en la siguiente tabla.
| Cargas de trabajo | Recomendaciones | Guía de implementación de clústeres | |
|---|---|---|---|
| Tipo de máquina | Organizador | ||
| Preentrenar modelos de base |
|
GKE | Crea un clúster de GKE optimizado para IA con la configuración predeterminada |
| Slurm | |||
| Entrenamiento de modelos grandes | A3 Ultra (NVIDIA H200 141 GB) | GKE | Crea un clúster de GKE optimizado para IA con la configuración predeterminada |
| Slurm | |||
| Entrenamiento de modelos grandes |
|
GKE | Maximiza el ancho de banda de red de la GPU en clústeres de modo Standard |
| Slurm | |||
Opción de consumo recomendada
Para obtener un alto nivel de garantía en la obtención de grandes clústeres de aceleradores, te recomendamos que uses una reserva. Específicamente, para minimizar los costos de los recursos reservados, te recomendamos que solicites una duración de reserva lo suficientemente larga como para recibir descuentos por compromiso de uso. Para obtener más información sobre las opciones de consumo, consulta Elige una opción de consumo.
Recomendaciones para ajustar modelos
Para ajustar modelos de base grandes, los clústeres más pequeños de aceleradores leen volúmenes moderados de datos. Estos aceleradores ajustan el modelo para realizar tareas específicas. Estos trabajos de ajuste se ejecutan durante días o incluso semanas.
En las siguientes secciones, se describen los aceleradores y las opciones de consumo recomendados para usar cuando se ajustan modelos.
Aceleradores recomendados
Para ajustar modelos en Google Cloud, te recomendamos que uses los tipos de máquinas optimizadas para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB) y que uses un orquestador para implementar el clúster.
Para implementar estos clústeres de aceleradores, también te recomendamos que uses Cluster Director o Cluster Toolkit. Para obtener más información, consulta la guía de implementación del clúster correspondiente al tipo de máquina que elijas en la siguiente tabla.
| Cargas de trabajo | Recomendaciones | Guía de implementación de clústeres | |
|---|---|---|---|
| Tipo de máquina | Organizador | ||
| Ajuste de modelos grandes | A3 Ultra (NVIDIA H200 141 GB) | GKE | Crea un clúster de GKE optimizado para IA con la configuración predeterminada |
| Slurm | |||
| Ajuste de modelos grandes |
|
GKE | Maximiza el ancho de banda de red de la GPU en clústeres del modo estándar |
| Slurm | |||
Opción de consumo recomendada
Para las cargas de trabajo de ajuste, usa una reserva futura en el modo de calendario para aprovisionar recursos. Para obtener más información sobre las opciones de consumo, consulta Cómo elegir una opción de consumo.
Recomendaciones para la inferencia
En las siguientes secciones, se describen los aceleradores y las opciones de consumo recomendados para realizar la inferencia.
Aceleradores recomendados
Los aceleradores recomendados para la inferencia dependen de si realizas una inferencia de frontera de varios hosts o de modelos grandes, o bien una inferencia de frontera de un solo host.
Aceleradores recomendados (varios hosts)
Para realizar la inferencia de modelos grandes o de frontera de varios hosts en Google Cloud, usa los tipos de máquinas optimizadas para aceleradores A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB) y, luego, implementa la máquina con un orquestador. Para implementar estos clústeres de aceleradores, también te recomendamos que uses Cluster Director o Cluster Toolkit. En la tabla, se proporcionan vínculos a las guías de implementación de clústeres para cada tipo de máquina recomendado.
| Cargas de trabajo | Recomendaciones | Guía de implementación de clústeres | |
|---|---|---|---|
| Tipo de máquina | Organizador | ||
| Inferencia de la frontera de varios hosts |
|
GKE | Crea un clúster de GKE optimizado para IA con la configuración predeterminada |
| Slurm | |||
| Inferencia de modelos grandes | A3 Ultra (NVIDIA H200 141 GB) | GKE | Crea un clúster de GKE optimizado para IA con la configuración predeterminada |
| Slurm | |||
| Inferencia de modelos grandes |
|
GKE | Maximiza el ancho de banda de red de la GPU en clústeres del modo estándar |
| Slurm | |||
Aceleradores recomendados (un solo host)
En la siguiente tabla, se describen los aceleradores que te recomendamos usar para realizar la inferencia de la frontera de un solo host. En la tabla, se proporcionan vínculos a las guías de implementación de VM para cada tipo de máquina recomendado.
| Cargas de trabajo | Recomendaciones | Guía de implementación de la VM | |
|---|---|---|---|
| Tipo de máquina | Organizador | ||
| Inferencia de vanguardia y generalizada de un solo host |
|
N/A | Crea una instancia de A4 o A3 Ultra |
|
Crea una instancia de A3 High o A3 Edge | ||
| G4 (NVIDIA RTX PRO 6000) | Crea una instancia de G4 | ||
| A2 (NVIDIA A100) | Crea una instancia de A2 | ||
| G2 (NVIDIA L4) | Crea una instancia de G2 | ||
| N1 (NVIDIA T4 o V100) | Crea una instancia N1 | ||
Opción de consumo recomendada
Para la inferencia, usa una reserva de larga duración o una reserva futura en modo de calendario. Para obtener más información sobre las opciones de consumo, consulta Cómo elegir una opción de consumo.
Recomendaciones para modelos pequeños o medianos
Para las cargas de trabajo de AA que involucran modelos de tamaño pequeño a mediano, lograr un equilibrio óptimo entre el precio y el rendimiento es una consideración principal.
Aceleradores recomendados
En la siguiente tabla, se describen los aceleradores recomendados para usar en cargas de trabajo de AA de modelos pequeños a medianos.
| Cargas de trabajo | Recomendaciones | Guía de implementación de la VM | |
|---|---|---|---|
| Tipo de máquina | Organizador | ||
| AA para modelos pequeños o medianos | G4 (NVIDIA RTX PRO 6000) | N/A | Crea una instancia de G4 |
| G2 (NVIDIA L4) | Crea una instancia de G2 | ||
| A2 (NVIDIA A100) | Crea una instancia de A2 | ||
| A3 Edge (NVIDIA H100 80 GB) | Crea una instancia de A3 Edge | ||
| N1 (NVIDIA T4 o V100) | Crea una instancia N1 | ||
Recomendaciones para HPC
Para las cargas de trabajo de HPC, cualquier serie de máquinas optimizadas para aceleradores o serie de máquinas optimizadas para procesamiento funciona bien. Si usas una serie de máquinas optimizadas para aceleradores, la mejor opción depende de la cantidad de procesamiento que se debe transferir a la GPU. Para obtener una lista detallada de las recomendaciones para las cargas de trabajo de HPC, consulta Prácticas recomendadas para ejecutar cargas de trabajo de HPC.
Resumen de recomendaciones
En la siguiente tabla, se resumen los aceleradores y las opciones de consumo recomendados para cada carga de trabajo.
| Recurso | Recomendación |
|---|---|
| Preentrenamiento del modelo | |
| Familia de máquinas | Usa uno de los siguientes tipos de máquinas optimizadas para aceleradores: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB). |
| Opción de consumo | "Usar reservas futuras estándar |
| Ajuste del modelo | |
| Familia de máquinas | Usa los tipos de máquinas optimizadas para aceleradores A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB) o A3 High (NVIDIA H100 de 80 GB). |
| Opción de consumo | "Usar reservas futuras estándar |
| Inferencia | |
| Familia de máquinas | Usa uno de los siguientes tipos de máquinas: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 de 141 GB), A3 Mega (NVIDIA H100 de 80 GB), A3 High (NVIDIA H100 de 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 de 80 GB) o N1 (NVIDIA T4 o V100). |
| Opción de consumo | Usar reservas, instancias según demanda o Spot |
| AA para modelos pequeños o medianos | |
| Familia de máquinas | Usa uno de los siguientes tipos de máquinas: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 de 80 GB) o N1 (NVIDIA T4 o V100). |
| Opción de consumo | Usar reservas estándar, de Spot o según demanda |
| Almacenamiento | Usa Cloud Storage FUSE |
| HPC | |
| Consulta la sección de resumen de las prácticas recomendadas para ejecutar cargas de trabajo de HPC | |
¿Qué sigue?
- Aprende a crear un clúster de GKE optimizado para IA.
- Obtén más información para crear un clúster de Slurm completamente administrado.
- Obtén más información para crear una instancia optimizada para IA.