Questo tutorial fornisce una guida passo passo per l'esecuzione dell'addestramento
di apprendimento per rinforzo (RL) su una singola istanza di macchina virtuale (VM) di Tensor Processing Unit (TPU) su Google Cloud utilizzando MaxText, uno stack di addestramento basato su JAX ad alte prestazioni per modelli linguistici di grandi dimensioni (LLM).v6e-8
Obiettivi
- Configura un'istanza VM Cloud TPU.
- Installa MaxText e le relative dipendenze.
- Converti un modello Hugging Face nel formato MaxText.
- Esegui un carico di lavoro di ottimizzazione relativa delle policy di gruppo (GRPO) RL sulla TPU.
- Converti il modello addestrato nel formato Hugging Face per la pubblicazione.
Costi
In questo documento vengono utilizzati i seguenti componenti fatturabili di Google Cloud:
Per generare una stima dei costi in base all'utilizzo previsto,
utilizza il calcolatore prezzi.
Al termine delle attività descritte in questo documento, puoi evitare l'addebito di ulteriori costi eliminando le risorse che hai creato. Per saperne di più, consulta Esegui la pulizia.
Prima di iniziare
Per utilizzare questo tutorial, è necessario un token di accesso a Hugging Face. Puoi registrarti per un account senza costi su Hugging Face. Una volta creato un account, genera un token di accesso:
- Nella pagina Benvenuto in Hugging Face, fai clic sull'avatar del tuo account e seleziona Token di accesso.
- Nella pagina Token di accesso, fai clic su Crea nuovo token.
- Seleziona il tipo di token Lettura e inserisci un nome per il token.
- Viene visualizzato il token di accesso. Salva il token in un luogo sicuro.
- Sul sito web di Hugging Face, accetta il contratto di licenza
per il modello che prevedi di addestrare. Questo tutorial utilizza il modello
llama3.1-8b-Instruct.
Per ottenere le autorizzazioni necessarie per completare questo tutorial, chiedi all'amministratore di concederti i seguenti ruoli IAM nel progetto:
- Amministratore TPU (
roles/tpu.admin) - Utente Service Account (
roles/iam.serviceAccountUser) - Editor Compute (
roles/compute.editor)
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
Potresti anche riuscire a ottenere le autorizzazioni richieste tramite i ruoli personalizzati o altri ruoli predefiniti.
Configura l'ambiente
Imposta le variabili di ambiente eseguendo lo script seguente:
Sostituisci quanto segue:
- YOUR_PROJECT_ID: il tuo Google Cloud ID progetto
- ZONE_NAME: la zona che vuoi utilizzare
- RESERVATION_NAME: la prenotazione di capacità
- TPU_MACHINE_NAME: il nome dell'istanza VM Cloud TPU
Autenticati con Google Cloud eseguendo questo comando:
gcloud auth login
Crea la VM Cloud TPU
Crea un'istanza VM Cloud TPU con 8 chip TPU v6e, associata alla prenotazione della capacità.
Dopo aver creato l'istanza VM, connettiti utilizzando SSH.
Completa i seguenti passaggi all'interno dell'istanza VM TPU.
Installare MaxText
Aggiorna i pacchetti di sistema all'interno dell'istanza VM TPU.
Installa Python 3.12, richiesto da MaxText, e il relativo pacchetto dell'ambiente virtuale.
Utilizza uv per velocizzare l'installazione del pacchetto Python.
Crea un ambiente virtuale denominato maxtext_venv e attivalo.
Installa MaxText e le dipendenze richieste per le attività post-addestramento.
Installa le dipendenze obbligatorie rimanenti eseguendo questo comando:
Converti il modello nel formato MaxText
Per addestrare il modello in formato MaxText, devi convertirlo dal formato Hugging Face al formato MaxText.
Fornisci i seguenti valori:
- Il token di accesso a Hugging Face
- Il nome del modello che vuoi utilizzare
- La directory in cui vuoi salvare il modello in formato MaxText
- Opzioni di caricamento e archiviazione
Sostituisci YOUR_HF_TOKEN con il token di accesso a Hugging Face che hai creato in precedenza.
Per convertire il modello dal formato Hugging Face al formato MaxText, esegui lo script seguente. La conversione richiede circa cinque minuti.
Inizia il carico di allenamento
Una volta completato il processo di conversione, puoi avviare il carico di lavoro RL.
Configura i parametri di addestramento del workload RL.
Avvia il job di addestramento. L'operazione richiede circa 10 minuti su un'istanza VM
v6e-8.
Converti il modello addestrato di nuovo nel formato Hugging Face
Al termine del carico di lavoro di addestramento, converti nuovamente il modello nel formato Hugging Face.
Imposta i percorsi per l'esportazione e i parametri addestrati.
Esegui la conversione nel formato Hugging Face.
Al termine della conversione, il modello ottimizzato archiviato in
/dev/shm/$MODEL_NAME/hf-trained è pronto per l'uso. Poiché perdi l'accesso ai contenuti della cartella /dev/shm quando la VM viene riavviata, devi spostare il modello ottimizzato in uno spazio di archiviazione permanente o caricarlo su Hugging Face Hub.
Esegui la pulizia
Per evitare addebiti aggiuntivi, elimina le risorse create durante questo tutorial.
Elimina l'istanza VM TPU
Elimina l'istanza VM Cloud TPU.
Passaggi successivi
- Per saperne di più su Cloud TPU, consulta Introduzione a Cloud TPU.
- Per i dettagli sull'architettura e sulla configurazione della TPU
v6e-8, vedi TPU v6e.