In dieser Anleitung erfahren Sie Schritt für Schritt, wie Sie das Training für
Reinforcement Learning (RL) auf einer einzelnen v6e-8
VM-Instanz (Virtual Machine) mit Tensor Processing Unit (TPU)
mit MaxText ausführen. Google Cloud MaxText ist ein leistungsstarker JAX-basierter Trainings
stack für Large Language Models (LLMs).
Ziele
- Cloud TPU-VM-Instanz einrichten
- MaxText und seine Abhängigkeiten installieren
- Hugging Face-Modell in das MaxText-Format konvertieren
- RL-Arbeitslast (Group Relative Policy Optimization, GRPO) auf der TPU ausführen
- Trainiertes Modell zur Bereitstellung wieder in das Hugging Face-Format konvertieren
Kosten
In diesem Dokument verwenden Sie die folgenden kostenpflichtigen Komponenten von Google Cloud:
Mit dem Preisrechner können Sie eine Kostenschätzung für Ihre voraussichtliche Nutzung vornehmen.
Verwenden Sie den Preisrechner.
Nach Abschluss der in diesem Dokument beschriebenen Aufgaben können Sie weitere Kosten vermeiden, indem Sie die erstellten Ressourcen löschen. Weitere Informationen finden Sie unter Bereinigen.
Hinweis
Für diese Anleitung benötigen Sie ein Hugging Face-Zugriffstoken. Sie können sich kostenlos bei Hugging Face registrieren. Nachdem Sie ein Konto haben, generieren Sie ein Zugriffstoken:
- Klicken Sie auf der Seite Welcome to Hugging Face (Willkommen bei Hugging Face) auf Ihren Kontoavatar und wählen Sie Access tokens (Zugriffstokens) aus.
- Klicken Sie auf der Seite Access tokens (Zugriffstokens) auf Create new token (Neues Token erstellen).
- Wählen Sie den Tokentyp Read (Lesen) aus und geben Sie einen Namen für Ihr Token ein.
- Ihr Zugriffstoken wird angezeigt. Speichern Sie das Token an einem sicheren Ort.
- Akzeptieren Sie auf der Hugging Face-Website die Lizenz
vereinbarung für das Modell, das Sie trainieren möchten. In dieser Anleitung wird das Modell
llama3.1-8b-Instructverwendet.
Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen für Ihr Projekt zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Ausführen dieser Anleitung benötigen:
- TPU-Administrator (
roles/tpu.admin) - Service Account User (
roles/iam.serviceAccountUser) - Compute-Bearbeiter (
roles/compute.editor)
Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.
Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.
Umgebung einrichten
Richten Sie Ihre Umgebungsvariablen ein, indem Sie das folgende Skript ausführen:
Ersetzen Sie Folgendes:
- YOUR_PROJECT_ID: Ihre Google Cloud Projekt-ID
- ZONE_NAME: die Zone, die Sie verwenden möchten
- RESERVATION_NAME: Ihre Kapazitätsreservierung
- TPU_MACHINE_NAME: der Name Ihrer Cloud TPU-VM Instanz
Authentifizieren Sie sich mit Google Cloud indem Sie den folgenden Befehl ausführen:
gcloud auth login
Cloud TPU-VM erstellen
Erstellen Sie eine Cloud TPU-VM-Instanz mit 8 v6e-TPU-Chips, die an Ihre Kapazitätsreservierung gebunden sind.
Nachdem die VM-Instanz erstellt wurde, stellen Sie mit SSH eine Verbindung zu ihr her.
Führen Sie die folgenden Schritte in Ihrer TPU-VM-Instanz aus.
MaxText installieren
Aktualisieren Sie die Systempakete in der TPU-VM-Instanz.
Installieren Sie Python 3.12, das für MaxText erforderlich ist, und das zugehörige Paket für die virtuelle Umgebung.
Verwenden Sie uv, um die Installation des Python-Pakets zu beschleunigen.
Erstellen Sie eine virtuelle Umgebung mit dem Namen maxtext_venv und aktivieren Sie sie.
Installieren Sie MaxText und die Abhängigkeiten, die für Aufgaben nach dem Training erforderlich sind.
Installieren Sie die verbleibenden erforderlichen Abhängigkeiten mit dem folgenden Befehl:
Modell in das MaxText-Format konvertieren
Wenn Sie das Modell im MaxText-Format trainieren möchten, müssen Sie es vom Hugging Face-Format in das MaxText-Format konvertieren.
Geben Sie folgende Werte an:
- Ihr Hugging Face-Zugriffstoken
- Der Name des Modells, das Sie verwenden möchten
- Das Verzeichnis, in dem Sie das Modell im MaxText-Format speichern möchten
- Optionen für das Laden und Speichern
Ersetzen Sie YOUR_HF_TOKEN durch das zuvor erstellte Hugging Face-Zugriffstoken.
Führen Sie das folgende Skript aus, um das Modell vom Hugging Face-Format in das MaxText-Format zu konvertieren. Diese Konvertierung dauert etwa fünf Minuten.
Trainingsarbeitslast starten
Nach Abschluss der Konvertierung können Sie die RL-Arbeitslast starten.
Konfigurieren Sie die Trainingsparameter für die RL-Arbeitslast.
Starten Sie den Trainingsjob. Auf einer
v6e-8-VM-Instanz dauert das etwa 10 Minuten.
Trainiertes Modell wieder in das Hugging Face-Format konvertieren
Nach Abschluss der Trainingsarbeitslast konvertieren Sie das Modell wieder in das Hugging Face-Format.
Legen Sie die Pfade für den Export und die trainierten Parameter fest.
Führen Sie die Konvertierung zurück in das Hugging Face-Format aus.
Nach Abschluss der Konvertierung ist Ihr abgestimmtes Modell, das unter /dev/shm/$MODEL_NAME/hf-trained gespeichert ist, einsatzbereit. Da Sie beim Neustart der VM den Zugriff auf die Inhalte des Ordners /dev/shm verlieren, sollten Sie das abgestimmte Modell in einen persistenten Speicher verschieben oder in den Hugging Face Hub hochladen.
Bereinigen
Löschen Sie die in dieser Anleitung erstellten Ressourcen, um zusätzliche Kosten zu vermeiden.
TPU-VM-Instanz löschen
Löschen Sie Ihre Cloud TPU-VM-Instanz.
Nächste Schritte
- Weitere Informationen zu Cloud TPU finden Sie unter Einführung in Cloud TPU.
- Architektur- und Konfigurationsdetails für die
v6e-8TPU finden Sie unter TPU v6e.