En este instructivo, se proporciona una guía paso a paso para ejecutar el entrenamiento de
aprendizaje por refuerzo (RL) en una sola instancia dev6e-8
máquina virtual (VM) de unidad de procesamiento tensorial (TPU)
con Google Cloud MaxText, una pila de entrenamiento de alto rendimiento basada en JAX para modelos de lenguaje grandes (LLM).
Objetivos
- Configurar una instancia de VM de Cloud TPU
- Instalar MaxText y sus dependencias
- Convertir un modelo de Hugging Face al formato MaxText
- Ejecutar una carga de trabajo de optimización de políticas relativas de grupo (GRPO) de RL en la TPU
- Volver a convertir el modelo entrenado al formato de Hugging Face para la entrega
Costos
En este documento, usarás los siguientes componentes facturables de Google Cloud:
Para generar una estimación de costos en función del uso previsto,
usa la calculadora de precios.
Cuando completes las tareas que se describen en este documento, podrás borrar los recursos que creaste para evitar que se te siga facturando. Para obtener más información, consulta Libera espacio.
Antes de comenzar
Para usar este instructivo, necesitas un token de acceso de Hugging Face. Puedes registrarte para obtener una cuenta gratuita en Hugging Face. Después de tener una cuenta, genera un token de acceso:
- En la página de bienvenida a Hugging Face, haz clic en el avatar de tu cuenta y selecciona Tokens de acceso.
- En la página Tokens de acceso, haz clic en Crear token nuevo.
- Selecciona el tipo de token Leer y, luego, ingresa un nombre para el token.
- Se mostrará tu token de acceso. Guarda el token en un lugar seguro.
- En el sitio web de Hugging Face, acepta el acuerdo de licencia
para el modelo que planeas entrenar. En este instructivo, se usa el modelo
llama3.1-8b-Instruct.
Si quieres obtener los permisos que necesitas para completar este instructivo, pídele a tu administrador que te otorgue los siguientes roles de IAM en tu proyecto:
- Administrador de TPU (
roles/tpu.admin) - Usuario de la cuenta de servicio (
roles/iam.serviceAccountUser) - Editor de Compute (
roles/compute.editor)
Para obtener más información sobre cómo otorgar roles, consulta Administra el acceso a proyectos, carpetas y organizaciones.
También puedes obtener los permisos necesarios mediante roles personalizados o cualquier otro rol predefinido.
Configura el entorno
Ejecuta la siguiente secuencia de comandos para configurar tus variables de entorno:
Reemplaza lo siguiente:
- YOUR_PROJECT_ID: Es el ID del Google Cloud proyecto.
- ZONE_NAME: Es la zona que deseas usar.
- RESERVATION_NAME: Es tu reserva de capacidad.
- TPU_MACHINE_NAME: Es el nombre de tu instancia de VM de Cloud TPU .
Realiza la autenticación con Google Cloud ejecutando el siguiente comando:
gcloud auth login
Crea tu VM de Cloud TPU
Crea una instancia de VM de Cloud TPU con 8 chips de TPU v6e, vinculados a tu reserva de capacidad.
Después de crear la instancia de VM, conéctate a ella con SSH.
Completa los siguientes pasos en tu instancia de TPU VM.
Instala MaxText
Actualiza los paquetes del sistema en la instancia de VM de TPU.
Instala Python 3.12, que requiere MaxText, y su paquete de entorno virtual.
Usa uv para acelerar la instalación del paquete de Python.
Crea un entorno virtual llamado maxtext_venv y actívalo.
Instala MaxText y las dependencias que requiere para las tareas posteriores al entrenamiento.
Ejecuta el siguiente comando para instalar las dependencias requeridas restantes:
Convierte el modelo al formato MaxText
Para entrenar el modelo en formato MaxText, debes convertirlo del formato Hugging Face al formato MaxText.
Ingresa los siguientes valores:
- Tu token de acceso de Hugging Face
- El nombre del modelo que deseas usar
- El directorio en el que deseas guardar el modelo en formato MaxText
- Opciones de carga y almacenamiento
Reemplaza YOUR_HF_TOKEN por el token de acceso de Hugging Face que creaste anteriormente.
Para convertir el modelo del formato Hugging Face al formato MaxText, ejecuta la siguiente secuencia de comandos. Esta conversión tarda unos cinco minutos en completarse.
Inicia la carga de trabajo de entrenamiento
Una vez que se complete el proceso de conversión, puedes iniciar la carga de trabajo de RL.
Configura los parámetros de entrenamiento de la carga de trabajo de RL.
Inicia el trabajo de entrenamiento. Esto tarda unos 10 minutos en una instancia de VM
v6e-8.
Vuelve a convertir el modelo entrenado al formato de Hugging Face
Una vez que se complete la carga de trabajo de entrenamiento, vuelve a convertir el modelo al formato de Hugging Face.
Establece las rutas de exportación y los parámetros entrenados.
Ejecuta la conversión de nuevo al formato de Hugging Face.
Una vez que se complete la conversión, tu modelo ajustado que se almacena en /dev/shm/$MODEL_NAME/hf-trained estará listo para usarse. Debido a que pierdes el acceso al contenido de la carpeta /dev/shm cuando se reinicia la VM, debes mover el modelo ajustado al almacenamiento persistente o subirlo a Hugging Face Hub.
Limpia
Para evitar que se generen cargos adicionales, borra los recursos creados durante este instructivo.
Borra la instancia de VM de TPU
Borra la instancia de VM de Cloud TPU.
¿Qué sigue?
- Para obtener más información sobre Cloud TPU, consulta Introducción a Cloud TPU.
- Para obtener detalles sobre la arquitectura y la configuración de la TPU
v6e-8, consulta TPU v6e.