Ce tutoriel explique comment exécuter un entraînement par apprentissage par renforcement (RL) multi-hôte sur un cluster v6e-32 de Tensor Processing Unit (TPU) à l'aide de MaxText et de Cluster Toolkit. Vous utilisez Cluster Toolkit pour exécuter une charge de travail d'entraînement multihôte et exporter les résultats au format Hugging Face pour le serving.
Objectifs
- Installez Cluster Toolkit et ses dépendances.
- Déployez un cluster Cluster Toolkit.
- Convertissez un modèle Hugging Face au format MaxText.
- Exécutez une charge de travail d'entraînement par renforcement sur le cluster TPU v6e.
- Reconvertissez le modèle affiné au format Hugging Face pour le diffuser.
Coûts
Dans ce document, vous utilisez les composants facturables suivants de Google Cloud :
Pour obtenir une estimation des coûts en fonction de votre utilisation prévue,
utilisez le simulateur de coût.
Une fois que vous avez terminé les tâches décrites dans ce document, supprimez les ressources que vous avez créées pour éviter que des frais vous soient facturés. Pour en savoir plus, consultez la section Effectuer un nettoyage.
Avant de commencer
Vous avez besoin d'un jeton d'accès Hugging Face pour suivre ce tutoriel. Vous pouvez créer un compte sans frais sur Hugging Face. Une fois que vous avez un compte, générez un jeton d'accès :
- Sur la page Bienvenue sur Hugging Face, cliquez sur l'avatar de votre compte, puis sélectionnez Jetons d'accès.
- Sur la page Jetons d'accès, cliquez sur Créer un jeton.
- Sélectionnez le type de jeton Lecture et saisissez un nom pour votre jeton.
- Votre jeton d'accès s'affiche. Enregistrez le jeton dans un endroit sûr.
- Sur le site Web Hugging Face, acceptez le contrat de licence du modèle que vous prévoyez d'entraîner. Ce tutoriel utilise le modèle
qwen3-30b-a3b.
Pour obtenir les autorisations nécessaires pour suivre ce tutoriel, demandez à votre administrateur de vous accorder les rôles IAM suivants sur votre projet :
- Administrateur de TPU (
roles/tpu.admin) - Administrateur Kubernetes Engine (
roles/container.admin) - Administrateur de Compute (
roles/compute.admin) - Administrateur de l'espace de stockage (
roles/storage.admin) -
Utilisateur du compte de service (
roles/iam.serviceAccountUser) - Administrateur de compte de service (
roles/iam.serviceAccountAdmin) - Administrateur de projet IAM (
roles/resourcemanager.projectIamAdmin) - Administrateur Service Usage (
roles/serviceusage.serviceUsageAdmin)
Pour en savoir plus sur l'attribution de rôles, consultez la page Gérer l'accès aux projets, aux dossiers et aux organisations.
Vous pouvez également obtenir les autorisations requises avec des rôles personnalisés ou d'autres rôles prédéfinis.
Configurer vos variables d'environnement
Configurez vos variables d'environnement :
Remplacez les éléments suivants :
- YOUR_PROJECT_ID : ID de votre projet Google Cloud .
- YOUR_REGION : région dans laquelle vous souhaitez déployer votre cluster.
- YOUR_ZONE : zone dans laquelle vous souhaitez déployer votre cluster.
- YOUR_CLUSTER_NAME : nom de votre cluster Google Kubernetes Engine (20 caractères maximum).
- YOUR_BUCKET_NAME : nom unique au niveau mondial pour un bucket Cloud Storage.
- YOUR_RESERVATION_NAME : nom de votre réservation.
- YOUR_HF_TOKEN : votre jeton d'accès Hugging Face.
Installer les dépendances de Cluster Toolkit
Pour suivre ce tutoriel depuis un client ou une station de travail Linux ou macOS, suivez les étapes correspondantes dans Installer les dépendances de la documentation Cluster Toolkit.
Si vous utilisez Cloud Shell, vous pouvez ignorer cette section.
Installer Cluster Toolkit
Installez le bundle prédéfini pour Cluster Toolkit dans votre répertoire de travail actuel en suivant les instructions de la page Installer Cluster Toolkit.
Par exemple, vous pouvez télécharger et extraire le bundle dans votre répertoire de travail actuel comme suit :
L'extraction du bundle dans votre répertoire de travail actuel fournit le binaire gcluster et les plans examples/ que vous utiliserez dans les étapes suivantes.
Créer votre cluster Cluster Toolkit
Pour créer et déployer un cluster Cluster Toolkit avec 32 puces TPU v6e, procédez comme suit :
Créez un bucket Cloud Storage :
Copiez le plan Cluster Toolkit dans votre répertoire de travail actuel :
Par défaut, le compte de service du pool de nœuds de votre cluster ne dispose pas des autorisations requises pour écrire dans votre bucket Cloud Storage. Pour autoriser le compte de service du pool de nœuds à écrire dans votre bucket Cloud Storage, vous devez lui attribuer le rôle
Storage Admin. Pour attribuer ce rôle, modifiez le fichiergke-tpu-v6e-advanced.yamlen mettant à jour le moduleservice-accountnomménode_pool_service_account:Utilisez la commande
gcluster deploypour déployer votre cluster Cluster Toolkit à l'aide du blueprintgke-tpu-v6e-advanced.yamlet transmettez les variables requises à l'aide de l'option--vars:Configurez l'authentification Container Registry et accordez le rôle d'administrateur de l'espace de stockage (
roles/storage.admin) à vos comptes de service GKE :
Convertir le modèle au format MaxText
Pour entraîner le modèle au format MaxText, vous devez le convertir du format Hugging Face au format MaxText.
Pour simplifier les commandes suivantes, utilisez la commande
gcluster job configpour configurer votre projet, votre cluster et votre emplacement par défaut :Exécutez la commande
gcluster job submitpour convertir le modèle du format Hugging Face au format MaxText et le stocker dans votre bucket Cloud Storage :Utilisez la commande
gcluster job logspour vérifier l'état du job de conversion :Vérifiez que les fichiers de modèle convertis sont disponibles dans votre bucket Cloud Storage :
Démarrer la charge de travail d'entraînement
Une fois le processus de conversion terminé, démarrez la charge de travail d'entraînement RL :
Pour vérifier l'état du job d'entraînement :
Pour vérifier que les points de contrôle de l'entraînement sont générés dans votre bucket Cloud Storage :
Reconvertir le modèle entraîné au format Hugging Face
Une fois la charge de travail d'entraînement terminée, reconvertissez le modèle au format Hugging Face :
Pour vérifier l'état du job de conversion :
Pour vérifier que les fichiers de configuration et les pondérations du modèle Hugging Face entraîné sont présents dans votre bucket Cloud Storage :
Effectuer un nettoyage
Pour éviter des frais supplémentaires, utilisez la commande gcluster destroy pour supprimer les ressources créées au cours de ce tutoriel :
Étapes suivantes
- Pour en savoir plus sur Cloud TPU, consultez la Présentation de Cloud TPU.
- Pour en savoir plus sur l'architecture et la configuration du TPU
v6e-32, consultez TPU v6e. - Pour en savoir plus sur Cluster Toolkit, consultez la présentation de Cluster Toolkit.