Calcolare i requisiti di Throughput riservato

Questa sezione spiega i concetti di unità della scala di AI generativa (GSU) e tassi di consumo. Il throughput riservato viene calcolato e il prezzo viene determinato utilizzando le unità della scala di AI generativa (GSU) e i tassi di consumo.

GSU e tasso di consumo

Un' unità della scala di AI generativa (GSU) è una misura del throughput per prompt e risposte. Questo importo specifica il throughput di cui eseguire il provisioning per un modello.

Un tasso di consumo è un rapporto che converte le unità di input e output (ad esempio token, caratteri o immagini) rispettivamente in token di input al secondo, caratteri di input al secondo o immagini di input al secondo. Questo rapporto rappresenta il throughput e viene utilizzato per produrre un'unità standard tra i modelli.

Modelli diversi utilizzano quantità di throughput diverse. Per informazioni sull' importo minimo di acquisto di GSU e sugli incrementi per ogni modello, consulta Modelli supportati e tassi di consumo in questo documento.

Questa equazione mostra come viene calcolato il throughput:

inputs_per_query = inputs_across_modalities_converted_using_burndown_rates
outputs_per_query = outputs_across_modalities_converted_using_burndown_rates

throughput_per_second = (inputs_per_query + outputs_per_query) * queries_per_second

Il throughput calcolato al secondo determina il numero di GSU necessarie per il tuo caso d'uso.

Considerazioni importanti

Per pianificare le tue esigenze di throughput riservato, esamina le seguenti considerazioni importanti:

  • Le richieste hanno la priorità.

    I clienti del throughput riservato hanno la priorità e vengono serviti prima delle richieste on demand.

  • Il throughput non si accumula.

    Il throughput inutilizzato non si accumula né viene riportato al mese successivo.

  • Il throughput riservato viene misurato in token al secondo, caratteri al secondo o immagini al secondo.

    Il throughput riservato non viene misurato esclusivamente in base alle query al minuto (QPM). Viene misurato in base alle dimensioni della query per il tuo caso d'uso, alle dimensioni della risposta e al QPM.

  • Il throughput riservato è specifico per un progetto, una regione, un modello e una versione.

    Il throughput riservato viene assegnato a una combinazione specifica di progetto-regione-modello-versione. Lo stesso modello chiamato da una regione diversa non verrà conteggiato ai fini della quota di throughput riservato e non avrà la priorità rispetto alle richieste on demand.

Memorizzazione nella cache del contesto

Il throughput riservato supporta la memorizzazione nella cache implicita e esplicita. Per informazioni sui modelli e sui limiti supportati, consulta Memorizzazione nella cache del contesto.

La memorizzazione nella cache implicita è abilitata per impostazione predefinita in tutti i Google Cloud progetti. La memorizzazione nella cache implicita riduce i costi e la latenza durante gli hit della cache. I token memorizzati nella cache vengono addebitati con uno sconto rispetto ai token di input standard quando si verifica un successo della cache. La memorizzazione nella cache esplicita offre un maggiore controllo e garantisce uno sconto quando vengono fatti riferimenti alle cache esplicite. Per scoprire come creare una cache di contesto per la memorizzazione nella cache esplicita, consulta Crea una cache di contesto. Per visualizzare gli sconti specifici del modello, consulta Panoramica della memorizzazione nella cache del contesto. Per il throughput riservato, lo sconto viene applicato tramite un tasso di consumo ridotto.

Ad esempio, Gemini 2.5 Pro ha i seguenti tassi di consumo per i token di testo di input e i token memorizzati nella cache:

  • 1 token di testo di input = 1 token

  • 1 token di testo di input memorizzato nella cache = 0,1 token

L'invio di 1000 token di input a questo modello comporta un consumo del throughput riservato di 1000 token di input al secondo. Tuttavia, se invii 1000 token memorizzati nella cache a Gemini 2.5 Pro, il throughput riservato verrà consumato di 100 token al secondo.

Tieni presente che questo può comportare un throughput più elevato per le query simili in cui i token non vengono memorizzati nella cache e lo sconto della cache non viene applicato.

Per visualizzare i tassi di consumo per i modelli supportati nel throughput riservato, consulta Modelli supportati e tassi di consumo.

Informazioni sul consumo per l'API Gemini Live

Il throughput riservato supporta Gemini 2.5 Flash con l'API Gemini Live. Per capire come calcolare il consumo durante l'utilizzo dell'API Gemini Live, consulta Calcola il throughput per l'API Gemini Live.

Per ulteriori informazioni sull'utilizzo del throughput riservato per Gemini 2.5 Flash con l'API Gemini Live, consulta Throughput riservato per l'API Gemini Live.

Esempio di stima delle esigenze di throughput riservato

Per stimare le tue esigenze di throughput riservato, utilizza lo strumento di stima nella Google Cloud console. Il seguente esempio illustra la procedura di stima della quantità di throughput riservato per il tuo modello. La regione non viene presa in considerazione nei calcoli di stima.

Questa tabella fornisce i tassi di consumo per Gemini 3.6 Flash che puoi utilizzare per seguire l'esempio.

Modello Throughput per GSU Unità Incremento minimo di acquisto di GSU Tassi di consumo
Gemini 3.6 Flash 675 Token 1 1 token di testo di input = 1 token
1 token di immagine di input = 1 token
1 token video di input = 1 token
1 token audio di input = 1 token
1 token di memorizzazione nella cache di testo di input = 0,1 token
1 token di memorizzazione nella cache di immagini di input = 0,1 token
1 token di memorizzazione nella cache di video di input = 0,1 token
1 token di memorizzazione nella cache di audio di input = 0,1 token
1 token di risposta di testo di output = 5 token

  1. Raccogli i requisiti. In questo esempio, il tuo requisito è verificare di poter supportare 10 query al secondo (QPS) di una query con un input di 1000 token di testo e 500 token audio, per ricevere un output di 300 token di risposta di testo utilizzando gemini-3.6-flash.

    Per calcolare il throughput per il tuo caso d'uso specifico, utilizza i tassi di consumo per il modello selezionato.

  2. Calcola il throughput. Moltiplica gli input per i tassi di consumo per ottenere i token di input totali:

    $\text{1000} \times (\text{1 token per token di testo di input}) + \text{500} \times (\text{1 token per token audio di input}) = \text{1500}$ token di input con consumo regolato per query.

    Moltiplica gli output per i tassi di consumo per ottenere i token di output totali:

    $\text{300} \times (\text{5 token per token di risposta di testo di output}) = \text{1500}$ token di output con consumo regolato per query.

    Somma i totali:

    $\text{1500 token di input con consumo regolato} + \text{1500 token di output con consumo regolato} = \text{3000}$ token totali per query.

    Moltiplica il numero totale di token per il QPS per ottenere il throughput totale al secondo:

    $\text{3000 token totali per query} \times \text{10 QPS} = \text{30.000}$ token totali al secondo.

  3. Calcola le GSU necessarie. Le GSU sono i token totali al secondo divisi per il throughput al secondo per GSU dalla tabella di consumo:

    $\text{30.000 token totali al secondo} \div \text{675 throughput al secondo per GSU} = \text{44,44}$ GSU.

    L'incremento minimo di acquisto di GSU per gemini-3.6-flash è 1, quindi avrai bisogno di 45 GSU per garantire il tuo workload.

Passaggi successivi