PayGo standard

Il modello di pagamento standard a consumo (Standard PayGo) è un'opzione di consumo per l'utilizzo della suite di modelli di AI generativa di Gemini Enterprise Agent Platform, inclusa la famiglia di modelli Gemini.

Standard PayGo ti consente di pagare solo per le risorse che consumi, senza richiedere impegni finanziari iniziali. Per fornire prestazioni più prevedibili per i carichi di lavoro scalabili, Standard PayGo incorpora un sistema di livelli di utilizzo. Agent Platform regola dinamicamente la capacità di throughput di base della tua organizzazione in base alla spesa totale per i servizi Agent Platform idonei in un periodo mobile di 30 giorni. Man mano che la spesa della tua organizzazione aumenta, viene automaticamente promossa a livelli più elevati che forniscono un maggiore accesso alle risorse condivise e soglie di rendimento più elevate. Per i carichi di lavoro che richiedono prestazioni più coerenti rispetto a Standard PayGo, valuta Priority PayGo. Per la capacità dedicata e garantita, consulta Throughput riservato.

Livelli di utilizzo e throughput

Ogni livello di utilizzo di Standard PayGo mira a fornire un throughput di base, misurato in token al minuto (TPM), che funge da limite inferiore di rendimento prevedibile per il traffico della tua organizzazione. I limiti di throughput si basano sulle richieste inviate all'endpoint globale. L'utilizzo dell'endpoint globale è una best practice, in quanto fornisce l'accesso a un pool di capacità di throughput più ampio e multiregionale e consente di instradare le richieste alla località con la maggiore disponibilità per massimizzare il rendimento.

Il traffico non è strettamente limitato al limite di throughput di base. Agent Platform consente al traffico di superare questo limite al meglio delle possibilità. Tuttavia, durante i periodi di forte domanda su Agent Platform, questo traffico in eccesso potrebbe avere una maggiore variabilità nel rendimento. Per ottimizzare il rendimento e ridurre al minimo la probabilità di ricevere questi errori, è anche una best practice uniformare il traffico il più possibile ogni minuto. Evita di inviare richieste con picchi elevati e istantanei. Un traffico elevato e istantaneo può comportare la limitazione anche se l'utilizzo medio al minuto è inferiore al limite. La distribuzione più uniforme delle chiamate API aiuta il sistema a gestire il carico in modo prevedibile e migliora il rendimento complessivo.

I seguenti livelli sono disponibili in Standard PayGo:

Famiglia di modelli Livello Spesa del cliente (30 giorni) TPM di traffico (a livello di organizzazione)
Modelli Gemini Pro Livello 1 10-250 $ 500.000
Livello 2 250-2000 $ 1.000.000
Livello 3 > 2000 $ 2.000.000
Modelli Gemini Flash e Flash-Lite Livello 1 10-250 $ 2.000.000
Livello 2 250-2000 $ 4.000.000
Livello 3 > 2000 $ 10.000.000

Tieni presente che il limite di throughput mostrato per una famiglia di modelli si applica indipendentemente a ogni modello all'interno di quella famiglia. Ad esempio, un cliente di livello 3 ha un throughput di base di 10.000.000 di TPM per Gemini 2.5 Flash. L'utilizzo rispetto a uno di questi limiti non influisce sul throughput di altri modelli. Non esiste un limite di richieste al minuto (RPM) separato per ogni livello. Tuttavia, si applica il limite di sistema di 30.000 RPM per modello per regione . Le richieste di Gemini con input multimodali sono soggette a i limiti di frequenza di sistema corrispondenti, tra cui immagini, audio, video e documenti.

Come funzionano i livelli di utilizzo

Il livello di utilizzo viene determinato automaticamente dalla spesa totale della tua organizzazione per i servizi Agent Platform idonei in un periodo mobile di 30 giorni. Man mano che la spesa della tua organizzazione aumenta, il sistema ti promuove a un livello superiore con un throughput maggiore.

Calcolo della spesa

Questo calcolo include una vasta gamma di servizi, dalle previsioni su tutte le famiglie di modelli Gemini alle istanze CPU, GPU e TPU di Agent Platform, nonché gli SKU basati sull'impegno, come il throughput riservato.

Fai clic per scoprire di più sugli SKU inclusi nel calcolo della spesa.

La tabella seguente elenca le categorie di Google Cloud SKU incluse nel calcolo della spesa totale.

Categoria Descrizione degli SKU inclusi
Modelli Gemini Tutte le famiglie di modelli Gemini (ad es. 2.0, 2.5, 3.0 nelle versioni Pro, Flash e Lite) per le previsioni in tutte le modalità (testo, immagine, audio, video), incluse le varianti batch, di contesto lungo, ottimizzate e "di pensiero"
Funzionalità dei modelli Gemini Tutti gli SKU Gemini correlati per funzionalità come la memorizzazione nella cache, lo spazio di archiviazione della cache e i livelli di priorità, in tutte le modalità e versioni dei modelli
CPU di Agent Platform Previsioni online e batch su tutte le famiglie di istanze basate su CPU (ad es. C2, C3, E2, N1, N2 e relative varianti)
GPU di Agent Platform Previsioni online e batch su tutte le istanze con accelerazione GPU NVIDIA (ad es. serie A100, H100, H200, B200, L4, T4, V100 e RTX)
TPU di Agent Platform Previsioni online e batch su tutte le istanze basate su TPU (ad es. TPU-v5e, v6e)
Gestione e tariffe Tutti gli SKU "Tariffa di gestione" associati a varie istanze di previsione di Agent Platform
Throughput riservato Tutti gli SKU basati sull'impegno per il throughput riservato
Altri servizi Servizi specializzati come "LLM Grounding for Gemini... with Google Search tool"

Verificare il livello di utilizzo

Per verificare il livello di utilizzo della tua organizzazione, vai alla dashboard di Agent Platform nella Google Cloud console. Per visualizzare il livello di utilizzo nella dashboard, devi disporre del ruolo Visualizzatore di Agent Platform (roles/aiplatform.viewer) nel progetto e del ruolo Visualizzatore account di fatturazione (roles/billing.viewer) nell'account di fatturazione.

Vai alla dashboard di Agent Platform

Verificare la spesa

Per esaminare la spesa di Agent Platform, vai a Fatturazione Cloud nella Google Cloud console. Tieni presente che la spesa viene aggregata a livello di organizzazione.

Vai a Fatturazione Cloud

Errori di esaurimento delle risorse (429)

Se ricevi un errore 429, non significa che hai raggiunto una quota fissa. Indica un'elevata contesa temporanea per una risorsa condivisa specifica. Ti consigliamo di implementare una strategia di ripetizione con backoff esponenziale per gestire questi errori, poiché la disponibilità in questo ambiente dinamico può cambiare rapidamente. Oltre a una strategia di ripetizione, ti consigliamo di utilizzare l'endpoint globale. A differenza di un endpoint regionale (ad esempio, us-central1), l'endpoint globale instrada dinamicamente le richieste alla regione con la maggiore capacità disponibile in quel momento. In questo modo, la tua applicazione può accedere a un pool di capacità condivisa più ampio e multiregionale, aumentando notevolmente il potenziale di burst riuscito e riducendo la probabilità di errori 429.

Per risultati ottimali, combina l'utilizzo dell'endpoint globale con l'uniformazione del traffico. Evita di inviare richieste con picchi elevati e istantanei, perché un traffico elevato e istantaneo può comportare la limitazione, anche se l'utilizzo medio al minuto rientra nel limite di throughput di base. La distribuzione più uniforme delle chiamate API aiuta il sistema a gestire il carico in modo prevedibile e migliora il rendimento complessivo. Per ulteriori informazioni su come gestire gli errori di esaurimento delle risorse, consulta Creare applicazioni LLM resilienti e ridurre gli errori 429 e Codice di errore 429.

Modelli supportati

I seguenti modelli Gemini in disponibilità generale (GA) e i relativi modelli ottimizzati con supervisione supportano Standard PayGo con livelli di utilizzo:

Fai clic per espandere i modelli supportati

I seguenti GA in disponibilità generale e i relativi modelli ottimizzati con supervisione supportano anche Standard PayGo, ma i livelli di utilizzo non si applicano a questi modelli:

Tieni presente che questi livelli non si applicano ai modelli in anteprima. Per informazioni più accurate e aggiornate, consulta la documentazione ufficiale specifica di ogni modello.

Monitorare il throughput e il rendimento

Per monitorare il consumo di token in tempo reale della tua organizzazione, vai a Metrics Explorer in Cloud Monitoring.

Vai a Esplora metriche

Per ulteriori informazioni sul monitoraggio del traffico degli endpoint dei modelli, consulta Monitorare i modelli.

Tieni presente che i livelli di utilizzo si applicano a livello di organizzazione. Per informazioni su come impostare l'ambito di osservabilità per rappresentare graficamente il throughput in più progetti della tua organizzazione, consulta Configurare gli ambiti di osservabilità per le query multiprogetto.

Passaggi successivi

Risorsa

Quote e limiti relativi ad Agent Platform, escluse le limitazioni specifiche del prodotto.

Panoramica

Scopri in che modo Google Cloud limita la quantità di una risorsa che può essere utilizzata nel tuo progetto Google Cloud e come le quote si applicano a una serie di tipi di risorse, inclusi hardware, software e componenti di rete.