Cómo calcular los requisitos de capacidad de procesamiento aprovisionada

En esta sección, se explican los conceptos de unidad de escala de IA generativa (GSU) y tasas de consumo. La capacidad de procesamiento aprovisionada se calcula y se le asigna un precio con las unidades de escala de IA generativa (GSU) y las tasas de consumo.

GSU y tasa de consumo

Una unidad de escala de IA generativa (GSU) es una medida de la capacidad de procesamiento de tus instrucciones y respuestas. Esta cantidad especifica la capacidad de procesamiento con la que se debe aprovisionar un modelo.

Una tasa de consumo es una proporción que convierte las unidades de entrada y salida (como tokens, caracteres o imágenes) en tokens de entrada por segundo, caracteres de entrada por segundo o imágenes de entrada por segundo, respectivamente. Esta proporción representa la capacidad de procesamiento y se usa para producir una unidad estándar en los modelos.

Los diferentes modelos usan diferentes cantidades de capacidades de procesamiento. Para obtener información sobre el importe mínimo de compra de GSU y los incrementos para cada modelo, consulta Modelos compatibles y tasas de consumo en este documento.

En esta ecuación, se muestra cómo se calcula la capacidad de procesamiento:

inputs_per_query = inputs_across_modalities_converted_using_burndown_rates
outputs_per_query = outputs_across_modalities_converted_using_burndown_rates

throughput_per_second = (inputs_per_query + outputs_per_query) * queries_per_second

La capacidad de procesamiento calculada por segundo determina cuántas GSU necesitas para tu caso de uso.

Consideraciones importantes

Para ayudarte a planificar tus necesidades de capacidad de procesamiento aprovisionada, revisa las siguientes consideraciones importantes:

  • Las solicitudes se priorizan.

    Los clientes de la capacidad de procesamiento aprovisionada se priorizan y se atienden primero antes de las solicitudes bajo demanda.

  • La capacidad de procesamiento no se acumula.

    La capacidad de procesamiento sin usar no se acumula ni se transfiere al mes siguiente.

  • La capacidad de procesamiento aprovisionada se mide en tokens por segundo, caracteres por segundo o imágenes por segundo.

    La capacidad de procesamiento aprovisionada no se mide únicamente en función de las consultas por minuto (QPM). Se mide en función del tamaño de la consulta para tu caso de uso, el tamaño de la respuesta y las QPM.

  • La capacidad de procesamiento aprovisionada es específica para un proyecto, una región, un modelo y una versión.

    La capacidad de procesamiento aprovisionada se asigna a una combinación específica de proyecto, región, modelo y versión. El mismo modelo llamado desde una región diferente no se tendrá en cuenta en tu cuota de capacidad de procesamiento aprovisionada y no se priorizará sobre las solicitudes bajo demanda.

El almacenamiento de contexto en caché

La capacidad de procesamiento aprovisionada admite el almacenamiento en caché implícito y explícito. Para obtener información sobre los modelos y límites admitidos, consulta El almacenamiento de contexto en caché.

El almacenamiento en caché implícito está habilitado en todos los Google Cloud proyectos de forma predeterminada. El almacenamiento en caché implícito reduce el costo y la latencia durante los aciertos de caché. Los tokens almacenados en caché se cobran con un descuento en relación con los tokens de entrada estándar cuando se produce un acierto de caché. El almacenamiento en caché explícito ofrece más control y garantiza un descuento cuando se hace referencia a las cachés explícitas. Para obtener información sobre cómo crear una caché de contexto para el almacenamiento en caché explícito, consulta Crea una caché de contexto. Para ver los descuentos específicos del modelo, consulta Descripción general del almacenamiento de contexto en caché. En el caso de la capacidad de procesamiento aprovisionada, el descuento se aplica a través de una tasa de consumo reducida.

Por ejemplo, Gemini 2.5 Pro tiene las siguientes tasas de consumo para los tokens de texto de entrada y los tokens almacenados en caché:

  • 1 token de texto de entrada = 1 token

  • 1 token de texto almacenado en caché de entrada = 0.1 tokens

Si envías 1,000 tokens de entrada a este modelo, se consumirá tu capacidad de procesamiento aprovisionada en 1,000 tokens de entrada por segundo. Sin embargo, si envías 1,000 tokens almacenados en caché a Gemini 2.5 Pro, se consumirá tu capacidad de procesamiento aprovisionada en 100 tokens por segundo.

Ten en cuenta que esto puede generar una mayor capacidad de procesamiento para consultas similares en las que los tokens no se almacenan en caché y no se aplica el descuento de caché.

Para ver las tasas de consumo de los modelos compatibles con la capacidad de procesamiento aprovisionada, consulta Modelos compatibles y tasas de consumo.

Comprende el consumo de la API de Gemini Live

La capacidad de procesamiento aprovisionada admite Gemini 2.5 Flash con la API de Gemini Live. Para comprender cómo calcular el consumo mientras usas la API de Gemini Live, consulta Calcula la capacidad de procesamiento de la API de Gemini Live.

Para obtener más información sobre el uso de la capacidad de procesamiento aprovisionada para Gemini 2.5 Flash con la API de Gemini Live, consulta Capacidad de procesamiento aprovisionada para la API de Gemini Live.

Ejemplo para estimar tus necesidades de capacidad de procesamiento aprovisionada

Para estimar tus necesidades de capacidad de procesamiento aprovisionada, usa la herramienta de estimación en la Google Cloud consola. En el siguiente ejemplo, se ilustra el proceso para estimar la cantidad de Capacidad de procesamiento aprovisionada de tu modelo. La región no se considera en los cálculos de estimación.

En esta tabla, se proporcionan las tasas de consumo de Gemini 3.6 Flash que puedes usar para seguir el ejemplo.

Modelo Capacidad de procesamiento por GSU Unidades Incremento mínimo de compra de GSU Tasas de consumo
Gemini 3.6 Flash 675 Tokens 1 1 token de texto de entrada = 1 token
1 token de imagen de entrada = 1 token
1 token de video de entrada = 1 token
1 token de audio de entrada = 1 token
1 token de almacenamiento en caché de texto de entrada = 0.1 tokens
1 token de almacenamiento en caché de imagen de entrada = 0.1 tokens
1 token de almacenamiento en caché de video de entrada = 0.1 tokens
1 token de almacenamiento en caché de audio de entrada = 0.1 tokens
1 token de respuesta de texto de salida = 5 tokens

  1. Reúne tus requisitos. En este ejemplo, tu requisito es verificar que puedes admitir 10 consultas por segundo (QPS) de una consulta con una entrada de 1,000 tokens de texto y 500 tokens de audio para recibir un resultado de 300 tokens de respuesta de texto con gemini-3.6-flash.

    Para calcular tu capacidad de procesamiento para tu caso de uso específico, usa las tasas de consumo del modelo seleccionado.

  2. Calcula tu capacidad de procesamiento. Multiplica tus entradas por las tasas de consumo para obtener los tokens de entrada totales:

    $\text{1,000} \times (\text{1 token por token de texto de entrada}) + \text{500} \times (\text{1 token por token de audio de entrada}) = \text{1,500}$ tokens de entrada ajustados por consumo por consulta.

    Multiplica tus salidas por las tasas de consumo para obtener los tokens de salida totales:

    $\text{300} \times (\text{5 tokens por token de respuesta de texto de salida}) = \text{1,500}$ tokens de salida ajustados por consumo por consulta.

    Suma los totales:

    $\text{1,500 tokens de entrada ajustados por consumo} + \text{1,500 tokens de salida ajustados por consumo} = \text{3,000}$ tokens totales por consulta.

    Multiplica la cantidad total de tokens por las QPS para obtener la capacidad de procesamiento total por segundo:

    $\text{3,000 tokens totales por consulta} \times \text{10 QPS} = \text{30,000}$ tokens totales por segundo.

  3. Calcula las GSU que necesitas. Las GSU son los tokens totales por segundo divididos por la capacidad de procesamiento por segundo por GSU de la tabla de consumo:

    $\text{30,000 tokens totales por segundo} \div \text{675 de capacidad de procesamiento por segundo por GSU} = \text{44.44}$ GSU.

    El incremento mínimo de compra de GSU para gemini-3.6-flash es 1, por lo que necesitarás 45 GSU para garantizar tu carga de trabajo.

¿Qué sigue?