Questo tutorial mostra come eseguire il deployment e pubblicare un Qwen3 Qwen3 con il framework di pubblicazione vLLM. Esegui il deployment del modello su una singola macchina virtuale (VM) A4 in Google Kubernetes Engine (GKE).
Questo tutorial è rivolto a machine learning (ML) engineer, amministratori e operatori di piattaforme e specialisti di dati e AI interessati a utilizzare le funzionalità di orchestrazione dei container Kubernetes per gestire i carichi di lavoro di inferenza.
Obiettivi
Accedere a Qwen3 utilizzando Hugging Face.
Preparare l'ambiente.
Creare un cluster GKE in modalità Autopilot.
Creare un secret di Kubernetes per le credenziali di Hugging Face.
Eseguire il deployment di un container vLLM nel cluster GKE.
Interagire con Qwen3 utilizzando curl.
Liberare spazio.
Costi
Questo tutorial utilizza i componenti fatturabili di Google Cloud, tra cui:
Per generare una stima dei costi in base all'utilizzo previsto, utilizza il Calcolatore prezzi.
Prima di iniziare
- Accedi al tuo Google Cloud account. Se non conosci Google Cloud, crea un account per valutare le prestazioni dei nostri prodotti in scenari reali. I nuovi clienti ricevono anche 300 $di crediti senza costi per l'esecuzione, il test e il deployment dei carichi di lavoro.
-
Installa Google Cloud CLI.
-
Se utilizzi un provider di identità (IdP) esterno, devi prima accedere a gcloud CLI con la tua identità federata.
-
Per inizializzare gcloud CLI, esegui questo comando:
gcloud init -
Crea o seleziona un Google Cloud progetto.
Ruoli richiesti per selezionare o creare un progetto
- Seleziona un progetto: la selezione di un progetto non richiede un ruolo IAM specifico. Puoi selezionare qualsiasi progetto su cui ti è stato concesso un ruolo.
-
Crea un progetto: per creare un progetto, devi disporre del ruolo Autore progetto
(
roles/resourcemanager.projectCreator), che contiene l'resourcemanager.projects.createautorizzazione. Scopri come concedere i ruoli.
-
Crea un Google Cloud progetto:
gcloud projects create PROJECT_ID
Sostituisci
PROJECT_IDcon un nome per il Google Cloud progetto che stai creando. -
Seleziona il Google Cloud progetto che hai creato:
gcloud config set project PROJECT_ID
Sostituisci
PROJECT_IDcon il nome del Google Cloud progetto.
-
Verifica che la fatturazione sia attivata per il tuo Google Cloud progetto.
Abilita l'API richiesta:
Ruoli richiesti per abilitare le API
Per abilitare le API, devi disporre del ruolo IAM Amministratore utilizzo servizi (
roles/serviceusage.serviceUsageAdmin), che contiene l'serviceusage.services.enableautorizzazione. Scopri come concedere i ruoli.gcloud services enable container.googleapis.com
-
Installa Google Cloud CLI.
-
Se utilizzi un provider di identità (IdP) esterno, devi prima accedere a gcloud CLI con la tua identità federata.
-
Per inizializzare gcloud CLI, esegui questo comando:
gcloud init -
Crea o seleziona un Google Cloud progetto.
Ruoli richiesti per selezionare o creare un progetto
- Seleziona un progetto: la selezione di un progetto non richiede un ruolo IAM specifico. Puoi selezionare qualsiasi progetto su cui ti è stato concesso un ruolo.
-
Crea un progetto: per creare un progetto, devi disporre del ruolo Autore progetto
(
roles/resourcemanager.projectCreator), che contiene l'resourcemanager.projects.createautorizzazione. Scopri come concedere i ruoli.
-
Crea un Google Cloud progetto:
gcloud projects create PROJECT_ID
Sostituisci
PROJECT_IDcon un nome per il Google Cloud progetto che stai creando. -
Seleziona il Google Cloud progetto che hai creato:
gcloud config set project PROJECT_ID
Sostituisci
PROJECT_IDcon il nome del Google Cloud progetto.
-
Verifica che la fatturazione sia attivata per il tuo Google Cloud progetto.
Abilita l'API richiesta:
Ruoli richiesti per abilitare le API
Per abilitare le API, devi disporre del ruolo IAM Amministratore utilizzo servizi (
roles/serviceusage.serviceUsageAdmin), che contiene l'serviceusage.services.enableautorizzazione. Scopri come concedere i ruoli.gcloud services enable container.googleapis.com
-
Concedi i ruoli al tuo account utente. Esegui il seguente comando una volta per ciascuno dei seguenti ruoli IAM:
roles/container.admingcloud projects add-iam-policy-binding PROJECT_ID --member="user:USER_IDENTIFIER" --role=ROLE
Sostituisci quanto segue:
PROJECT_ID: il tuo ID progetto.USER_IDENTIFIER: l'identificatore del tuo account utente. Ad esempio,myemail@example.com.ROLE: il ruolo IAM che concedi al tuo account utente.
- Accedi a un account Hugging Face o creane uno.
Accedere a Qwen3 utilizzando Hugging Face
Per utilizzare Hugging Face per accedere a Qwen3:
- Accedi a Hugging Face
- Crea un token di accesso
readdi Hugging Face. Fai clic su Il tuo profilo > Impostazioni > Token di accesso > +Crea nuovo token. - Specifica un nome a tua scelta per il token e poi seleziona un ruolo. Il livello di autorizzazione del ruolo minimo che puoi selezionare per questo tutorial è Lettura.
- Seleziona Crea token.
- Copia e salva il token generato negli appunti. Lo utilizzerai più avanti in questo tutorial.
Preparare l'ambiente
Per preparare l'ambiente, imposta le variabili di ambiente predefinite:
gcloud config set project PROJECT_ID
gcloud config set billing/quota_project PROJECT_ID
export PROJECT_ID=$(gcloud config get project)
export RESERVATION_URL=RESERVATION_URL
export REGION=REGION
export CLUSTER_NAME=CLUSTER_NAME
export HUGGING_FACE_TOKEN=HUGGING_FACE_TOKEN
export NETWORK=NETWORK_NAME
export SUBNETWORK=SUBNETWORK_NAME
Sostituisci quanto segue:
PROJECT_ID: l'ID del Google Cloud progetto in cui vuoi creare il cluster GKE.RESERVATION_URL: l'URL della prenotazione che vuoi utilizzare per creare il cluster GKE. In base al progetto in cui esiste la prenotazione, specifica uno dei seguenti valori:La prenotazione esiste nel tuo progetto:
RESERVATION_NAMELa prenotazione esiste in un progetto diverso e il tuo progetto può utilizzare la prenotazione:
projects/RESERVATION_PROJECT_ID/reservations/RESERVATION_NAME
REGION: la regione in cui vuoi creare il cluster GKE. Puoi creare il cluster solo nella regione in cui esiste la prenotazione.CLUSTER_NAME: il nome del cluster GKE da creare.HUGGING_FACE_TOKEN: il token di accesso a Hugging Face che hai creato nella sezione precedente.NETWORK_NAME: la rete utilizzata dal cluster GKE. Specifica uno dei seguenti valori:Se hai creato una rete personalizzata, specifica il nome della rete.
In caso contrario, specifica
default.
SUBNETWORK_NAME: la subnet utilizzata dal cluster GKE. Specifica uno dei seguenti valori:Se hai creato una subnet personalizzata, specifica il nome della subnet. Puoi specificare solo una subnet che si trova nella stessa regione della prenotazione.
In caso contrario, specifica
default.
Creare un cluster GKE in modalità Autopilot
Per creare un cluster GKE in modalità Autopilot, esegui questo comando:
gcloud container clusters create-auto $CLUSTER_NAME \
--project=$PROJECT_ID \
--region=$REGION \
--release-channel=rapid \
--network=$NETWORK \
--subnetwork=$SUBNETWORK
La creazione del cluster GKE potrebbe richiedere un po' di tempo. Per verificare che la creazione del cluster sia stata completata, vai a Cluster Kubernetes nella Google Cloud console. Google Cloud
Creare un secret di Kubernetes per le credenziali di Hugging Face
Per creare un secret di Kubernetes per le credenziali di Hugging Face:
Configura
kubectlper comunicare con il cluster GKE:gcloud container clusters get-credentials $CLUSTER_NAME \ --location=$REGIONCrea un secret di Kubernetes per archiviare il token di Hugging Face:
kubectl create secret generic hf-secret \ --from-literal=hf_token=${HUGGING_FACE_TOKEN} \ --dry-run=client -o yaml | kubectl apply -f -
Eseguire il deployment di un container vLLM nel cluster GKE
Per eseguire il deployment del container vLLM per pubblicare il modello Qwen3 utilizzando i deployment di Kubernetes:
Crea un file
qwen3-235b-deploy.yamlcon il deployment vLLM scelto. :apiVersion: apps/v1 kind: Deployment metadata: name: vllm-qwen3-deployment spec: replicas: 1 selector: matchLabels: app: qwen3-server template: metadata: labels: app: qwen3-server ai.gke.io/model: Qwen3-235B-A22B-Instruct-2507 ai.gke.io/inference-server: vllm spec: containers: - name: qwen-inference-server image: us-docker.pkg.dev/vertex-ai/vertex-vision-model-garden-dockers/pytorch-vllm-serve:20250801_0916_RC01 resources: requests: cpu: "10" memory: "1000Gi" ephemeral-storage: "500Gi" nvidia.com/gpu: "8" limits: cpu: "10" memory: "1000Gi" ephemeral-storage: "500Gi" nvidia.com/gpu: "8" command: ["python3", "-m", "vllm.entrypoints.openai.api_server"] args: - --model=$(MODEL_ID) - --tensor-parallel-size=8 - --host=0.0.0.0 - --port=8000 - --max-model-len=8192 - --max-num-seqs=4 - --dtype=bfloat16 env: - name: MODEL_ID value: "Qwen/Qwen3-235B-A22B-Instruct-2507" - name: HUGGING_FACE_HUB_TOKEN valueFrom: secretKeyRef: name: hf-secret key: hf_token volumeMounts: - mountPath: /dev/shm name: dshm livenessProbe: httpGet: path: /health port: 8000 initialDelaySeconds: 1320 periodSeconds: 10 readinessProbe: httpGet: path: /health port: 8000 initialDelaySeconds: 1320 periodSeconds: 5 volumes: - name: dshm emptyDir: medium: Memory nodeSelector: cloud.google.com/gke-accelerator: nvidia-b200 cloud.google.com/reservation-name: RESERVATION_URL cloud.google.com/reservation-affinity: "specific" cloud.google.com/gke-gpu-driver-version: latest --- apiVersion: v1 kind: Service metadata: name: qwen3-service spec: selector: app: qwen3-server type: ClusterIP ports: - protocol: TCP port: 8000 targetPort: 8000 --- apiVersion: monitoring.googleapis.com/v1 kind: PodMonitoring metadata: name: vllm-qwen3-monitoring spec: selector: matchLabels: app: qwen3-server endpoints: - port: 8000 path: /metrics interval: 30sApplica il file
qwen3-235b-deploy.yamlal cluster GKE:kubectl apply -f qwen3-235b-deploy.yamlDurante il processo di deployment, il container deve scaricare il modello
Qwen3-235B-A22B-Instruct-2507da Hugging Face. Per questo motivo, il completamento del deployment del container potrebbe richiedere fino a 30 minuti.Per visualizzare lo stato di completamento, esegui questo comando:
kubectl wait \ --for=condition=Available \ --timeout=1500s deployment/vllm-qwen3-deploymentIl flag
--timeout=1500sconsente al comando di monitorare il deployment per un massimo di 25 minuti.
Interagire con Qwen3 utilizzando curl
Per verificare il modello Qwen3 di cui hai eseguito il deployment:
Configura il port forwarding a Qwen3:
kubectl port-forward service/qwen3-service 8000:8000Apri una nuova finestra del terminale. Puoi quindi chattare con il modello utilizzando
curl:curl http://127.0.0.1:8000/v1/chat/completions \ -X POST \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen/Qwen3-235B-A22B-Instruct-2507", "messages": [ { "role": "user", "content": "Describe a GPU in one short sentence?" } ] }'L'output è simile al seguente:
{ "id": "chatcmpl-a926ddf7ef2745ca832bda096e867764", "object": "chat.completion", "created": 1755023619, "model": "Qwen/Qwen3-235B-A22B-Instruct-2507", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "A GPU is a specialized electronic circuit designed to rapidly process and render graphics and perform parallel computations.", "refusal": null, "annotations": null, "audio": null, "function_call": null, "tool_calls": [], "reasoning_content": null }, "logprobs": null, "finish_reason": "stop", "stop_reason": null } ], "service_tier": null, "system_fingerprint": null, "usage": { "prompt_tokens": 16, "total_tokens": 36, "completion_tokens": 20, "prompt_tokens_details": null }, "prompt_logprobs": null, "kv_transfer_params": null }
Osservare le prestazioni del modello
Se vuoi osservare le prestazioni del modello, puoi utilizzare l'integrazione della dashboard vLLM in Cloud Monitoring. Questa dashboard ti aiuta a visualizzare le metriche di prestazioni critiche per il tuo modello, come la velocità effettiva dei token, la latenza di rete e le percentuali di errore. Per informazioni, consulta vLLM nella documentazione di Monitoring.
Liberare spazio
Per evitare che al tuo account Google Cloud vengano addebitati costi relativi alle risorse utilizzate in questo tutorial, elimina il progetto che contiene le risorse oppure mantieni il progetto ed elimina le singole risorse.
Eliminare il progetto
Elimina un Google Cloud progetto:
gcloud projects delete PROJECT_ID
Eliminare il cluster GKE
Per eliminare il cluster GKE, esegui questo comando:
gcloud container clusters delete $CLUSTER_NAME \
--region=$REGION
Eliminare le risorse
Per eliminare il file qwen3-235b-deploy.yaml e il secret di Kubernetes dal cluster GKE, esegui questi comandi:
kubectl delete -f qwen3-235b-deploy.yaml
kubectl delete secret hf-secret