Ce tutoriel fournit un guide pas à pas pour exécuter
l'entraînement par apprentissage par renforcement (RL) sur une seule v6e-8
instance de machine virtuelle (VM) Tensor Processing Unit (TPU)
su Google Cloud en utilisant MaxText, une pile d'entraînement haute performance basée sur JAX pour les grands modèles de langage (LLM).
Objectifs
- Configurer une instance de VM Cloud TPU.
- Installer MaxText et ses dépendances.
- Convertir un modèle Hugging Face au format MaxText.
- Exécuter une charge de travail d'optimisation de la stratégie relative au groupe (GRPO) RL sur le TPU.
- Reconvertir le modèle entraîné au format Hugging Face pour la diffusion.
Coûts
Dans ce document, vous utilisez les composants facturables suivants de Google Cloud:
Obtenez une estimation des coûts en fonction de votre utilisation prévue,
utilisez le simulateur de coût.
Une fois que vous avez terminé les tâches décrites dans ce document, supprimez les ressources que vous avez créées pour éviter que des frais vous soient facturés. Pour en savoir plus, consultez la section Effectuer un nettoyage.
Avant de commencer
Vous avez besoin d'un jeton d'accès Hugging Face pour suivre ce tutoriel. Vous pouvez créer un compte sans frais sur Hugging Face. Une fois que vous avez un compte, générez un jeton d'accès :
- Sur la page "Welcome to Hugging Face" (Bienvenue sur Hugging Face), cliquez sur l'avatar de votre compte, puis sélectionnez Access tokens (Jetons d'accès).
- Sur la page Access tokens (Jetons d'accès), cliquez sur Create new token (Créer un jeton).
- Sélectionnez le type de jeton Read (Lecture), puis saisissez un nom pour votre jeton.
- Votre jeton d'accès s'affiche. Enregistrez le jeton dans un endroit sûr.
- Sur le site Web Hugging Face, acceptez le contrat de licence
du modèle que vous prévoyez d'entraîner. Ce tutoriel utilise le modèle
llama3.1-8b-Instruct.
Pour obtenir les autorisations nécessaires pour suivre ce tutoriel, demandez à votre administrateur de vous accorder les rôles IAM suivants sur votre projet :
- Administrateur TPU (
roles/tpu.admin) - Utilisateur du compte de service (
roles/iam.serviceAccountUser) - Éditeur Compute (
roles/compute.editor)
Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.
Vous pouvez également obtenir les autorisations requises via des rôles personnalisés ou d'autres rôles prédéfinis.
Configurer l'environnement
Configurez vos variables d'environnement en exécutant le script suivant :
Remplacez les éléments suivants :
- YOUR_PROJECT_ID: ID de votre Google Cloud projet
- ZONE_NAME : zone que vous souhaitez utiliser
- RESERVATION_NAME : réservation de capacité
- TPU_MACHINE_NAME : nom de votre instance de VM Cloud TPU
Authentifiez-vous auprès de Google Cloud en exécutant la commande suivante :
gcloud auth login
Créer votre VM Cloud TPU
Créez une instance de VM Cloud TPU avec huit puces TPU v6e, liées à votre réservation de capacité.
Une fois l'instance de VM créée, connectez-vous à celle-ci à l'aide de SSH.
Suivez les étapes ci-dessous dans votre instance de VM TPU.
Installer MaxText
Mettez à jour les packages système dans l'instance de VM TPU.
Installez Python 3.12, qui est requis par MaxText, et son package d'environnement virtuel.
Utilisez uv pour accélérer l'installation du package Python.
Créez un environnement virtuel nommé maxtext_venv, puis activez-le.
Installez MaxText et les dépendances requises pour les tâches post-entraînement.
Installez les dépendances requises restantes en exécutant la commande suivante :
Convertir le modèle au format MaxText
Pour entraîner le modèle au format MaxText, vous devez le convertir du format Hugging Face au format MaxText.
Indiquez les valeurs suivantes :
- Votre jeton d'accès Hugging Face
- Nom du modèle que vous souhaitez utiliser
- Répertoire dans lequel vous souhaitez enregistrer le modèle au format MaxText
- Options de chargement et de stockage
Remplacez YOUR_HF_TOKEN par le jeton d'accès Hugging Face que vous avez créé précédemment.
Pour convertir le modèle du format Hugging Face au format MaxText, exécutez le script suivant. Cette conversion prend environ cinq minutes.
Démarrer la charge de travail d'entraînement
Une fois le processus de conversion terminé, vous pouvez démarrer la charge de travail RL.
Configurez les paramètres d'entraînement de la charge de travail RL.
Démarrez la tâche d'entraînement. Cette opération prend environ 10 minutes sur une instance de VM
v6e-8.
Reconvertir le modèle entraîné au format Hugging Face
Une fois la charge de travail d'entraînement terminée, reconvertissez le modèle au format Hugging Face.
Définissez les chemins d'exportation et les paramètres entraînés.
Exécutez la reconversion au format Hugging Face.
Une fois la conversion terminée, votre modèle réglé stocké dans /dev/shm/$MODEL_NAME/hf-trained est prêt à être utilisé. Étant donné que vous perdez l'accès au contenu du dossier /dev/shm lorsque la VM redémarre, vous devez déplacer le modèle réglé vers un stockage persistant ou le importer dans le hub Hugging Face.
Effectuer un nettoyage
Pour éviter des frais supplémentaires, supprimez les ressources créées lors de ce tutoriel.
Supprimer votre instance de VM TPU
Supprimez votre instance de VM Cloud TPU.
Étape suivante
- Pour en savoir plus sur Cloud TPU, consultez la Présentation de Cloud TPU.
- Pour en savoir plus sur l'architecture et la configuration du TPU
v6e-8, consultez TPU v6e.