Questo tutorial mostra come pubblicare il modello meta-llama/Llama-3.1-8B utilizzando il framework di pubblicazione vLLM TPU su una VM TPU v6e.
Obiettivi
- Configurare l'ambiente.
- Esegui vLLM con Llama-3.1-8B.
- Invia una richiesta di inferenza.
- Esegui un carico di lavoro di benchmark.
- Eseguire la pulizia.
Costi
Questo tutorial utilizza i componenti fatturabili di Google Cloud, tra cui:
Per generare una stima dei costi in base all'utilizzo previsto, utilizza il calcolatore prezzi.
Prima di iniziare
Prima di seguire questo tutorial, segui le istruzioni nella pagina Configura l'ambiente Cloud TPU. Le istruzioni ti guidano nei passaggi necessari per creare un progetto Google Cloud e configurarlo per l'utilizzo di Cloud TPU. Puoi anche utilizzare un progettoGoogle Cloud esistente. Se scegli di farlo, puoi saltare il passaggio di creazione di un Google Cloud progetto e iniziare con Configura l'ambiente per utilizzare Cloud TPU.
Per utilizzare questo tutorial, è necessario un token di accesso a Hugging Face. Puoi registrarti per un account senza costi su Hugging Face. Una volta creato un account, genera un token di accesso:
- Nella pagina Benvenuto in Hugging Face, fai clic sull'avatar del tuo account e seleziona Token di accesso.
- Nella pagina Token di accesso, fai clic su Crea nuovo token.
- Seleziona il tipo di token Lettura e inserisci un nome per il token.
- Viene visualizzato il token di accesso. Salva il token in un luogo sicuro.
Configura l'ambiente
Risorse in coda
Crea una VM Cloud TPU v6e utilizzando l'API Queued Resources. Per Llama-3.1-8B, ti consigliamo di utilizzare una TPU v6e-1.
Imposta le variabili:
- PROJECT: il nome del progetto.
- TPU_NAME: il nome della macchina VM TPU che creerai.
- ZONE: la zona cloud in cui creare la nuova VM.
- TPU_TYPE: il tipo di VM TPU che crei. Ad esempio:
v6e-1ov6e-4. - QR_ID: il nome della risorsa in coda che crei.
Crea la richiesta di risorsa in coda:
Verifica che la VM TPU sia pronta.
Ad esempio, quando lo stato è ACTIVE:
name: projects/your-project-id/locations/your-zone/queuedResources/your-queued-resource-id
state:
state: ACTIVE
tpu:
nodeSpec:
- node:
acceleratorType: v6e-1
bootDisk: {}
networkConfig:
enableExternalIps: true
queuedResource: projects/your-project-number/locations/your-zone/queuedResources/your-queued-resource-id
runtimeVersion: v2-alpha-tpuv6e
schedulingConfig: {}
serviceAccount: {}
shieldedInstanceConfig: {}
useTpuVm: true
nodeId: your-node-id
parent: projects/your-project-number/locations/your-zone
Prenotazione
Crea una VM Cloud TPU v6e utilizzando una prenotazione. Per Llama-3.1-8B, ti consigliamo di utilizzare una TPU v6e-1. Inizia impostando le variabili di ambiente:
Imposta le variabili:
- PROJECT: il nome del progetto.
- TPU_NAME: il nome della macchina VM TPU che creerai.
- ZONE: la zona cloud in cui creare la nuova VM.
- TPU_TYPE: il tipo di VM TPU che crei. Ad esempio:
v6e-1ov6e-4. - RESERVATION: il nome della prenotazione con le tue TPU.
Crea la VM TPU utilizzando la prenotazione:
Connettiti alla VM TPU.
Esegui vLLM con Llama-3.1-8B
Imposta le variabili del token Hugging Face e del nome del modello.
export HF_TOKEN="YOUR_HF_TOKEN" export MODEL_NAME="meta-llama/Llama-3.1-8B"All'interno della VM TPU, esegui il container Docker vLLM in modalità detached e avvia il server vLLM. Questo comando utilizza una dimensione della memoria condivisa di 10 GB.
Controlla i log del server per verificare che sia in esecuzione.
Quando il server vLLM è in esecuzione, viene visualizzato un output simile al seguente. Dopo la visualizzazione dell'output, premi
CTRL+Cper tornare al terminale.(APIServer pid=7) INFO: Started server process [7] (APIServer pid=7) INFO: Waiting for application startup. (APIServer pid=7) INFO: Application startup complete.
Inviare una richiesta di inferenza
Una volta in esecuzione, puoi inviare richieste all'API. Per saperne di più, consulta la documentazione di riferimento dell'API vLLM.
Invia una richiesta di test al server utilizzando
curl.
La risposta viene restituita in formato JSON.
Esegui un carico di lavoro di benchmark
Puoi eseguire benchmark sul server in esecuzione dal secondo terminale.
All'interno del contenitore, installa la libreria
datasets.All'interno del container, esegui il comando
vllm bench serve.
I risultati del benchmark vengono visualizzati nel seguente modo:
============ Serving Benchmark Result ============
Successful requests: 1000
Failed requests: 0
Benchmark duration (s): 73.97
Total input tokens: 1024000
Total generated tokens: 128000
Request throughput (req/s): 13.52
Output token throughput (tok/s): 1730.38
Peak output token throughput (tok/s): 2522.00
Peak concurrent requests: 1000.00
Total Token throughput (tok/s): 15573.42
---------------Time to First Token----------------
Mean TTFT (ms): 34834.97
Median TTFT (ms): 34486.19
P99 TTFT (ms): 70234.40
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms): 47.30
Median TPOT (ms): 48.57
P99 TPOT (ms): 48.60
---------------Inter-token Latency----------------
Mean ITL (ms): 47.31
Median ITL (ms): 53.49
P99 ITL (ms): 54.58
==================================================
Esegui la pulizia
Per evitare che al tuo account Google Cloud vengano addebitati costi relativi alle risorse utilizzate in questo tutorial, elimina il progetto che contiene le risorse oppure mantieni il progetto ed elimina le singole risorse.
- Nel terminale, digita exit per disconnetterti dalla VM TPU.
Eliminare le risorse
Puoi eliminare il progetto, il che comporterà l'eliminazione di tutte le risorse, oppure puoi mantenerlo ed eliminare le risorse.
Elimina il progetto
Per eliminare il tuo progetto Google Cloud e tutte le risorse associate, esegui:
gcloud projects delete $PROJECT_ID
Elimina risorse TPU
Risorse in coda
Elimina le risorse Cloud TPU. Il comando seguente elimina sia la
richiesta di risorse in coda sia la VM TPU utilizzando il parametro --force.
Prenotazione
Elimina la VM Cloud TPU. Utilizza il seguente comando per terminare la VM, restituendo le TPU alla tua prenotazione.
Passaggi successivi
- Scopri di più su vLLM su Cloud TPU.
- Scopri di più su Cloud TPU.