En este instructivo, se muestra cómo entregar el modelo Qwen/Qwen3-8B-Base con el framework de entrega de vLLM TPU en una VM de TPU v6e.
Objetivos
- Configura el entorno.
- Ejecuta vLLM con Qwen3-8B-Base.
- Envía una solicitud de inferencia.
- Ejecuta una carga de trabajo de comparativa.
- Realiza una limpieza
Costos
En este instructivo, se usan componentes facturables de Google Cloud, que incluyen lo siguiente:
Para generar una estimación de costos en función del uso previsto, usa la calculadora de precios.
Antes de comenzar
Antes de seguir este instructivo, sigue las instrucciones de la página Configura el entorno de Cloud TPU. Las instrucciones te guían por los pasos necesarios para crear un Google Cloud proyecto y configurarlo para usar Cloud TPU. También puedes usar un proyecto existente Google Cloud Si decides hacerlo, puedes omitir el paso de crear un Google Cloud proyecto y comenzar con Configura tu entorno para usar Cloud TPU.
Para usar este instructivo, necesitas un token de acceso de Hugging Face. Puedes registrarte para obtener una cuenta gratuita en Hugging Face. Una vez que tengas una cuenta, genera un token de acceso:
- En la página Welcome to Hugging Face, haz clic en el avatar de tu cuenta y selecciona Access tokens.
- En la página Access Tokens, haz clic en Create new token.
- Selecciona el tipo de token Read y, luego, ingresa un nombre para tu token.
- Se muestra tu token de acceso. Guarda el token en un lugar seguro.
Configura tu entorno
Recursos en cola
Crea una VM de Cloud TPU v6e con la API de recursos en cola. Para Qwen3-8B-Base, recomendamos usar una TPU v6e-1.
Configura las variables:
- PROJECT - El nombre del proyecto
- TPU_NAME - El nombre de la máquina de la VM de TPU que crearás
- ZONE - La zona de la nube en la que crearás la VM nueva
- TPU_TYPE - El tipo de VM de TPU que crearás Por ejemplo:
v6e-1ov6e-4 - QR_ID - Nombre del recurso en cola que crearás
Crea la solicitud de recurso en cola:
Verifica que tu VM de TPU esté lista.
Por ejemplo, cuando el estado es ACTIVE:
name: projects/your-project-id/locations/your-zone/queuedResources/your-queued-resource-id
state:
state: ACTIVE
tpu:
nodeSpec:
- node:
acceleratorType: v6e-1
bootDisk: {}
networkConfig:
enableExternalIps: true
queuedResource: projects/your-project-number/locations/your-zone/queuedResources/your-queued-resource-id
runtimeVersion: v2-alpha-tpuv6e
schedulingConfig: {}
serviceAccount: {}
shieldedInstanceConfig: {}
useTpuVm: true
nodeId: your-node-id
parent: projects/your-project-number/locations/your-zone
Reserva
Crea una VM de Cloud TPU v6e con una reserva. Para Qwen3-8B-Base, recomendamos usar una TPU v6e-1. Comienza por configurar las variables de entorno:
Configura las variables:
- PROJECT - El nombre del proyecto
- TPU_NAME - El nombre de la máquina de la VM de TPU que crearás
- ZONE - La zona de la nube en la que crearás la VM nueva
- TPU_TYPE - El tipo de VM de TPU que crearás Por ejemplo:
v6e-1ov6e-4 - RESERVATION - Nombre de la reserva con tus TPU.
Crea la VM de TPU con tu reserva:
Conéctate a la VM de TPU.
Ejecuta vLLM con Qwen3-8B-Base
Configura las variables de nombre del modelo y token de Hugging Face.
export HF_TOKEN="YOUR_HF_TOKEN" export MODEL_NAME="Qwen/Qwen3-8B-Base"Dentro de la VM de TPU, ejecuta el contenedor de Docker de vLLM en modo separado y, luego, inicia el servidor de vLLM. Este comando usa un tamaño de memoria compartida de 10 GB.
Consulta los registros del servidor para confirmar que se esté ejecutando.
Cuando el servidor de vLLM esté en ejecución, verás un resultado similar al siguiente. Después de que se muestre el resultado, presiona
CTRL+Cpara volver a la terminal.(APIServer pid=7) INFO: Started server process [7] (APIServer pid=7) INFO: Waiting for application startup. (APIServer pid=7) INFO: Application startup complete.
Envía una solicitud de inferencia
Una vez que el servidor de vLLM esté en ejecución, puedes enviar solicitudes a la API. Para obtener más información, consulta la documentación de referencia de la API de vLLM.
Envía una solicitud de prueba al servidor con
curl.
La respuesta se muestra en formato JSON.
Ejecuta una carga de trabajo de comparativa
Puedes ejecutar comparativas en el servidor en ejecución desde tu segunda terminal.
Dentro del contenedor, instala la biblioteca
datasets.Dentro del contenedor, ejecuta el comando
vllm bench serve.
Los resultados de la comparativa aparecen de la siguiente manera:
============ Serving Benchmark Result ============
Successful requests: 1000
Failed requests: 0
Benchmark duration (s): 73.97
Total input tokens: 1024000
Total generated tokens: 128000
Request throughput (req/s): 13.52
Output token throughput (tok/s): 1730.38
Peak output token throughput (tok/s): 2522.00
Peak concurrent requests: 1000.00
Total Token throughput (tok/s): 15573.42
---------------Time to First Token----------------
Mean TTFT (ms): 34834.97
Median TTFT (ms): 34486.19
P99 TTFT (ms): 70234.40
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms): 47.30
Median TPOT (ms): 48.57
P99 TPOT (ms): 48.60
---------------Inter-token Latency----------------
Mean ITL (ms): 47.31
Median ITL (ms): 53.49
P99 ITL (ms): 54.58
==================================================
Limpia
Para evitar que se apliquen cargos a tu cuenta de Google Cloud por los recursos usados en este instructivo, borra el proyecto que contiene los recursos o conserva el proyecto y borra los recursos individuales.
- En tu terminal, escribe exit para desconectarte de la VM de TPU.
Borra tus recursos
Puedes borrar el proyecto, lo que borrará todos los recursos, o puedes conservar el proyecto y borrar los recursos.
Borra tu proyecto
Para borrar tu Google Cloud proyecto y todos los recursos asociados, ejecuta lo siguiente:
gcloud projects delete $PROJECT_ID
Borra los recursos de TPU
Recursos en cola
Borra tus recursos de Cloud TPU. El siguiente comando borra la solicitud de recursos en cola y la VM de TPU con el parámetro --force.
Reserva
Borra tu VM de Cloud TPU. Usa el siguiente comando para finalizar la VM y liberar las TPU en tu reserva.
¿Qué sigue?
- Obtén más información sobre vLLM en Cloud TPU.
- Más información sobre Cloud TPU.