Modelos compatibles

En las siguientes tablas, se muestran los modelos que admiten la capacidad de procesamiento aprovisionada, la capacidad de procesamiento para cada unidad de escala de IA generativa (GSU) y las tasas de consumo para cada modelo.

Modelos de Google

La capacidad de procesamiento aprovisionada solo admite modelos a los que llamas directamente desde tu proyecto con el ID de modelo específico y no con un alias de modelo. Para usar la capacidad de procesamiento aprovisionada y realizar llamadas a la API de un modelo, debes usar el ID de versión del modelo específico (por ejemplo, gemini-2.0-flash-001) y no un alias de versión del modelo.

Si bien el procesamiento aprovisionado garantiza la capacidad para las solicitudes de tu modelo, no incluye ni omite las cuotas de otras herramientas que podrías usar, como Grounding. Según el tamaño de tu carga de trabajo, es posible que debas solicitar una cuota adicional para estas herramientas por separado.

Además, la Capacidad de procesamiento aprovisionada no admite modelos que se llamen desde otros productos de Gemini Enterprise Agent Platform, como Vertex AI Agents y Agent Search. Por ejemplo, si realizas llamadas a la API de Gemini 2.0 Flash mientras usas Agent Search, tu pedido de capacidad de procesamiento aprovisionada para Gemini 2.0 Flash no garantizará las llamadas que realice Agent Search.

El rendimiento aprovisionado no admite llamadas de predicción por lotes.

En la siguiente tabla, se muestran las tasas de capacidad de procesamiento, incremento de compra y consumo para los modelos de Google que admiten la capacidad de procesamiento aprovisionada. Tu capacidad de procesamiento por segundo se define como la entrada de tu instrucción y la salida generada en todas las solicitudes por segundo.

Para saber cuántos tokens requiere tu carga de trabajo, consulta el tokenizador del SDK o la API de countTokens.

Modelo Capacidad de procesamiento por segundo y por GSU Unidades Incremento mínimo de compra de GSU Tasas de consumo

Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite)

Última versión compatible: gemini-3.1-flash-lite-image

4030 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de texto de respuesta de salida = 6 tokens
1 token de texto de explicación de salida = 6 tokens
1 token de imagen de salida = 120 tokens

Gemini 3 Pro Image

Última versión compatible: gemini-3-pro-image

500 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de respuesta de salida = 6 tokens
1 token de texto de razonamiento de salida = 6 tokens
1 token de imagen de salida = 60 tokens

Imagen de Gemini 3.1 Flash

Última versión compatible: gemini-3.1-flash-image

2015 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de texto de respuesta de salida = 6 tokens
1 token de texto de explicación de salida = 6 tokens
1 token de imagen de salida = 120 tokens

Gemini 3.5 Flash

Última versión compatible: gemini-3.5-flash

675 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 1 token
1 token de almacenamiento en caché de texto de entrada = 0.1 tokens
1 token de almacenamiento en caché de imagen de entrada = 0.1 tokens
1 token de almacenamiento en caché de video de entrada = 0.1 tokens
1 token de almacenamiento en caché de audio de entrada = 0.1 tokens
1 token de texto de salida = 6 tokens

Gemini 3.1 Flash-Lite

Última versión compatible: gemini-3.1-flash-lite

4030 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 2 tokens
1 token de almacenamiento en caché de texto de entrada = 0.1 tokens
1 token de almacenamiento en caché de imagen de entrada = 0.1 tokens
1 token de almacenamiento en caché de video de entrada = 0.1 tokens
1 token de almacenamiento en caché de audio de entrada = 0.2 tokens
1 token de texto de respuesta de salida = 6 tokens
1 token de texto de razonamiento de salida = 6 tokens

Imagen de Gemini 3.1 Flash

Versión compatible más reciente: gemini-3.1-flash-image-preview (versión preliminar)

2015 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 6 tokens
1 token de imagen de salida = 120 tokens

Gemini 3.1 Pro

Versión compatible más reciente: gemini-3.1-pro-preview (versión preliminar)

500 Tokens 1 Menos de 200,000 tokens de entrada:
1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 1 token
1 token de caché de entrada = 0.1 tokens
1 token de texto de respuesta de salida = 6 tokens
1 token de texto de explicación de salida = 6 tokens

Más de 200,000 tokens de entrada:
1 token de texto de entrada = 2 tokens
1 token de imagen de entrada = 2 tokens
1 token de video de entrada = 2 tokens
1 token de audio de entrada = 2 tokens
1 token de caché de entrada = 0.2 tokens
1 token de texto de respuesta de salida = 9 tokens
1 token de texto de explicación de salida = 9 tokens

Gemini 3 Flash

Versión compatible más reciente: gemini-3-flash-preview (versión preliminar)

2015 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 2 tokens
1 token de almacenamiento en caché de texto, imagen o video de entrada = 0.1 tokens
1 token de almacenamiento en caché de audio de entrada = 0.2 tokens
1 token de texto de respuesta de salida = 6 tokens
1 token de texto de razonamiento de salida = 6 tokens

Gemini 3 Pro Image

Versión compatible más reciente: gemini-3-pro-image-preview (versión preliminar)

500 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 6 tokens
1 token de pensamiento de salida = 6 tokens
1 token de imagen de salida = 60 tokens

Gemini 2.5 Pro

Última versión compatible: gemini-2.5-pro

650 Tokens 1 Menos de 200,000 tokens de entrada:
1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 1 token
1 token de texto de respuesta de salida = 8 tokens
1 token de texto de explicación de salida = 8 tokens

Más de 200,000 tokens de entrada:
1 token de texto de entrada = 2 tokens
1 token de imagen de entrada = 2 tokens
1 token de video de entrada = 2 tokens
1 token de audio de entrada = 2 tokens
1 token de texto de respuesta de salida = 12 tokens
1 token de texto de explicación de salida = 12 tokens

Gemini 2.5 Flash Image

Última versión compatible: gemini-2.5-flash-image

2,690 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 9 tokens
1 token de imagen de salida = 100 tokens

Gemini 2.5 Flash

Última versión compatible: gemini-2.5-flash

2690 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 4 tokens
1 token de texto de respuesta de salida = 9 tokens
1 token de texto de razonamiento de salida = 9 tokens

Gemini 2.5 Flash-Lite

Versión compatible más reciente (GA): gemini-2.5-flash-lite

Versión compatible más reciente (vista previa): gemini-2.5-flash-lite-preview-09-2025

8,070 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 3 tokens
1 token de texto de respuesta de salida = 4 tokens
1 token de texto de razonamiento de salida = 4 tokens

Gemini 2.5 Flash con audio nativo de la API de Gemini Live

Última versión compatible: gemini-live-2.5-flash-native-audio

1,620 Tokens 1 1 token de texto de entrada = 1 token
1 token de audio de entrada = 6 tokens
1 token de video de entrada = 6 tokens
1 token de imagen de entrada = 6 tokens
1 token de memoria de sesión de entrada = 1 token
1 token de texto de salida = 4 tokens
1 token de audio de salida = 24 tokens

Veo 3.1 Lite Generate

Última versión compatible: veo-3.1-lite-generate-001

0.0350 Segundos de video (720p) 1 1 segundo de video de salida (720p) = 1 segundo de video de salida
Segundos de audio y video (720p) 1 1 segundo de video y audio de salida (720p) = 1.75 segundos de video de salida
Segundos de video (1080p) 1 1 segundo de video de salida en 1080p = 1.75 segundos de video de salida en 720p
Segundos de video y audio (1080p) 1 1 segundo de audio y video de salida (1080p) = 2.33 segundos de video de salida (720p)

Veo 3.1

Última versión compatible: veo-3.1-generate-001

0.0040 Segundos de video 1 1 segundo de video de salida = 1 segundo de video de salida
Segundos de audio y video 1 1 segundo de audio y video de salida = 2 segundos de video de salida

Veo 3.1 Fast

Última versión compatible: veo-3.1-fast-generate-001

0.01 Segundos de video (720p) 1 1 segundo de video de salida (720p) = 1 segundo de video de salida
Segundos de video y audio (720p) 1 1 segundo de video y audio de salida (720p) = 1.30 segundos de video de salida
Segundos de video (1080p) 1 1 segundo de video de salida en 1080p = 1.30 segundos de video de salida en 720p
Segundos de video y audio (1080p) 1 1 segundo de video y audio de salida (1080p) = 1.60 segundos de video de salida (720p)
Segundos de video (4K) 1 1 segundo de video de salida (4K) = 3.40 segundos de video de salida (720p)
Segundos de video y audio (4K) 1 1 segundo de video y audio de salida (4K) = 4 segundos de video de salida (720p)

Veo 3

Última versión compatible: veo-3.0-generate-001

0.0040 Segundos de video 1 1 segundo de video de salida = 1 segundo de video de salida
Segundos de audio y video 1 1 segundo de audio y video de salida = 2 segundos de video de salida

Veo 3 Fast

Última versión compatible: veo-3.0-fast-generate-001

0.01 Segundos de video (720p) 1 1 segundo de video de salida (720p) = 1 segundo de video de salida
Segundos de video y audio (720p) 1 1 segundo de video y audio de salida (720p) = 1.30 segundos de video de salida
Segundos de video (1080p) 1 1 segundo de video de salida en 1080p = 1.30 segundos de video de salida en 720p
Segundos de video y audio (1080p) 1 1 segundo de video y audio de salida (1080p) = 1.60 segundos de video de salida (720p)

Para obtener información sobre las capacidades de un modelo y los límites de entrada o salida, consulta la documentación del modelo.

Puedes actualizar a modelos nuevos a medida que estén disponibles. Para obtener información sobre la disponibilidad de los modelos y las fechas de interrupción, consulta Modelos de Google.

Para obtener más información sobre las ubicaciones admitidas, consulta Ubicaciones disponibles.

Modelos de socios

En la siguiente tabla, se muestran las tasas de capacidad de procesamiento, incremento de compra y consumo para los modelos de socios que admiten la capacidad de procesamiento aprovisionada. Los modelos de Claude se miden en tokens por segundo, lo que se define como un total de tokens de entrada y salida en todas las solicitudes por segundo.

Modelo Capacidad de procesamiento por GSU (tokens/s) Compra mínima de GSU Incremento de compra de GSU Tasas de consumo
Claude Sonnet 5 de Anthropic en Google Cloud 350 25 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Fable 5 de Anthropic en Google Cloud 105 1 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Opus 4.8 de Anthropic en Google Cloud 210 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Opus 4.7 de Anthropic en Google Cloud 210 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Sonnet 4.6 de Anthropic en Google Cloud 350 25 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Opus 4.6 de Anthropic en Google Cloud 210 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Opus 4.5 de Anthropic en Google Cloud 210 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Sonnet 4.5 de Anthropic en Google Cloud 350 25 1 Menos de 200,000 tokens de entrada:
1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token

Mayor o igual que 200,000 tokens de entrada:
1 token de entrada = 2 tokens
1 token de salida = 7.5 tokens
1 token de escritura en caché de 5 min = 2.5 tokens
1 token de escritura en caché de 1 h = 4 tokens
1 token de acierto de caché = 0.2 token
Claude Opus 4.1 de Anthropic en Google Cloud 70 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Haiku 4.5 de Anthropic en Google Cloud 1,050 8 1 Menos de 200,000 tokens de entrada:
1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Opus 4 de Anthropic en Google Cloud 70 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude Sonnet 4 de Anthropic en Google Cloud 350 25 1 Menos de 200,000 tokens de entrada:
1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token

Mayor o igual que 200,000 tokens de entrada:
1 token de entrada = 2 tokens
1 token de salida = 7.5 tokens
1 token de escritura en caché de 5 min = 2.5 tokens
1 token de escritura en caché de 1 h = 4 tokens
1 token de acierto de caché = 0.2 token
Claude 3.7 Sonnet de Anthropic en Google Cloud (obsoleto) 350 25 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de acierto de caché = 0.1 token
Claude 3.5 Sonnet v2 de Anthropic en Google Cloud (obsoleto) 350 25 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de acierto de caché = 0.1 token
Claude 3.5 Haiku de Anthropic en Google Cloud (obsoleto) 2,000 10 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude 3 Opus de Anthropic en Google Cloud 70 35 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de acierto de caché = 0.1 token
Claude 3 Haiku de Anthropic en Google Cloud (obsoleto) 4,200 5 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de escritura en caché de 1 h = 2 tokens
1 token de acierto de caché = 0.1 token
Claude 3.5 Sonnet de Anthropic en Google Cloud (obsoleto) 350 25 1 1 token de entrada = 1 token
1 token de salida = 5 tokens
1 token de escritura en caché de 5 min = 1.25 tokens
1 token de acierto de caché = 0.1 token

Para obtener información sobre las ubicaciones compatibles, consulta Disponibilidad de regiones de Claude Anthropic. Para solicitar el procesamiento aprovisionado para los modelos de Anthropic, comunícate con tu Google Cloud representante de cuenta.

Modelos abiertos

En la siguiente tabla, se muestran las tasas de capacidad de procesamiento, incremento de compra y consumo para los modelos abiertos que admiten la capacidad de procesamiento aprovisionada.

Modelo Capacidad de procesamiento por GSU (tokens/s) Compra mínima de GSU Incremento de compra de GSU Tasas de consumo

DeepSeek-OCR

Última versión compatible: deepseek-ocr-maas

3,360 1 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 4 tokens

DeepSeek-V3.2

DeepSeek-V3.2

Última versión compatible: deepseek-v3.2-maas

1,680 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

Gemma 4 26B A4B IT

Última versión compatible: gemma-4-26b-a4b-it-maas

La compatibilidad con la capacidad de procesamiento aprovisionada para este modelo se factura con los mismos SKU que los modelos de Google, pero está sujeta a las capacidades del modelo abierto.

6,725 1 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 4 tokens

Kimi K2 Thinking

Última versión compatible: kimi-k2-thinking-maas

1,680 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

Llama 3.3 70B

Última versión compatible: llama-3.3-70b-instruct-maas

1,400 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 1 token

Llama 4 Maverick 17B-128E

Última versión compatible: llama-4-maverick-17b-128e-instruct-maas

2,800 1 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 4 tokens

Llama 4 Scout 17B-16E

Última versión compatible: llama-4-scout-17b-16e-instruct-maas

4,035 1 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de texto de salida = 3 tokens

MiniMax M2

Última versión compatible: minimax-m2-maas

3,360 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

OpenAI gpt-oss 120B

Última versión compatible: gpt-oss-120b-maas

11,205 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

OpenAI gpt-oss 20B

Última versión compatible: gpt-oss-20b-maas

14,405 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

Qwen3 235B

Última versión compatible: qwen3-235b-a22b-instruct-2507-maas

4,035 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

Qwen3 Coder

Última versión compatible: qwen3-coder-480b-a35b-instruct-maas

1,010 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

Qwen3-Next-80B Instruct

Última versión compatible: qwen3-next-80b-a3b-instruct-maas

6,725 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 8 tokens

Qwen3-Next-80B Thinking

Última versión compatible: qwen3-next-80b-a3b-thinking-maas

6,725 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 8 tokens

GLM 4.7

Última versión compatible: glm-4.7-maas

1,685 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 4 tokens

GLM 5

Última versión compatible: glm-5-maas

1,010 1 1 1 token de texto de entrada = 1 token
1 token de texto de salida = 3 tokens

Capacidades disponibles para los modelos abiertos y de Google

En la siguiente tabla, se enumeran las capacidades disponibles con el procesamiento aprovisionado para los modelos de Google y los modelos abiertos:

Función Modelos de Google Modelos abiertos (versión preliminar)
Cómo hacer pedidos a través de la consola de Google Cloud
Admite extremos globales Consulta Compatibilidad con el modelo de extremo global. Consulta Compatibilidad con el modelo de extremo global.
Admite modelos ajustados de forma supervisada No
Admite el uso de claves de API No
Integrado en el almacenamiento implícito de contexto en caché No aplicable
Integrado con el almacenamiento en caché de contexto explícito No aplicable
Procesamiento de AA Disponible en regiones específicas. Para obtener más detalles, consulta Capacidad de procesamiento aprovisionada de una sola zona. No aplicable
Condiciones de pedido disponibles 1 semana, 1 mes, 3 meses y 1 año 1 semana, 1 mes, 3 meses y 1 año
Cambia el orden desde la consola. No
Estados del pedido: Pendiente de revisión, Aprobado, Activo, Vencido
Los excedentes se extienden al pago por uso de forma predeterminada
Control de encabezado de la API: Usa "dedicated" para usar solo el rendimiento aprovisionado o "shared" para usar solo el pago por uso.
Supervisión: Métricas, paneles y alertas

Compatibilidad con el modelo de extremo global

La capacidad de procesamiento aprovisionada admite el extremo global para los modelos de Google y los modelos abiertos.

De forma predeterminada, el tráfico que supera la cuota de capacidad de procesamiento aprovisionada usa el extremo global.

Para asignar capacidad de procesamiento aprovisionada al extremo global de un modelo, selecciona global como la región cuando realices un pedido de capacidad de procesamiento aprovisionada.

Modelos de Google con compatibilidad con extremos globales

En la siguiente tabla, se enumeran los modelos de Google para los que la capacidad de procesamiento aprovisionada admite el extremo global:

Modelo Versión del modelo compatible más reciente
Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) gemini-3.1-flash-lite-image
Gemini 3 Pro Image gemini-3-pro-image
Imagen de Gemini 3.1 Flash gemini-3.1-flash-image
Gemini 3.5 Flash gemini-3.5-flash
Gemini 3.1 Flash-Lite gemini-3.1-flash-lite
Gemini 3.1 Flash Image vista previa gemini-3.1-flash-image-preview
Gemini 3.1 Pro versión preliminar gemini-3.1-pro-preview
Gemini 3 Flash vista previa gemini-3-flash-preview
Imagen de Gemini 3 Pro vista previa gemini-3-pro-image-preview
Gemini 2.5 Pro gemini-2.5-pro
Gemini 2.5 Flash Image gemini-2.5-flash-image
Gemini 2.5 Flash gemini-2.5-flash
Gemini 2.5 Flash-Lite gemini-2.5-flash-lite

Modelos abiertos con compatibilidad con endpoints globales

En la siguiente tabla, se enumeran los modelos abiertos para los que el rendimiento aprovisionado admite el extremo global:

Modelo Versión del modelo compatible más reciente
DeepSeek-OCR deepseek-ocr-maas
DeepSeek-V3.2 deepseek-v3.2-maas
Kimi K2, Thinking kimi-k2-thinking-maas
MiniMax M2 minimax-m2-maas
OpenAI gpt-oss 120B gpt-oss-120b-maas
Qwen3-Next-80B Instruct qwen3-next-80b-a3b-instruct-maas
Qwen3-Next-80B Thinking qwen3-next-80b-a3b-thinking-maas
GLM 4.7 glm-4.7-maas
GLM 5 glm-5-maas

Compatibilidad con modelos ajustados de forma supervisada

Los siguientes elementos son compatibles con los modelos de Google que admiten el ajuste supervisado:

  • La capacidad de procesamiento aprovisionada se puede aplicar tanto a los modelos base como a las versiones ajustadas de forma supervisada de esos modelos base.

  • Los extremos de modelos ajustados de forma supervisada y sus modelos base correspondientes se incluyen en la misma cuota de capacidad de procesamiento aprovisionada.

    Por ejemplo, el rendimiento aprovisionado comprado para gemini-3.1-flash-lite para un proyecto específico prioriza las solicitudes que se realizan desde versiones ajustadas supervisadas de gemini-3.1-flash-lite creadas dentro de ese proyecto. Usa el encabezado adecuado para controlar el comportamiento del tráfico.

A partir de Gemini 3, las tasas de agotamiento para la inferencia de modelos ajustados son más altas en comparación con la inferencia de modelos base. Este premio es proporcional al premio de inferencia ajustado para el modelo. Por ejemplo, si la inferencia ajustada cobra un 50% más que la inferencia del modelo base, la tasa de agotamiento de la inferencia ajustada sería un 50% más alta. En este caso, si la inferencia del modelo base de 1 token de texto de entrada era de 1 token, la inferencia del modelo ajustado de 1 token de texto de entrada sería de 1.5 tokens.

Antes de Gemini 3, los extremos de modelos ajustados con supervisión y sus modelos base correspondientes se contabilizaban para la misma cuota de capacidad de procesamiento aprovisionada con las mismas tasas de agotamiento.

¿Qué sigue?