Questa pagina fornisce un elenco di quote per regione e modello e mostra come visualizzare e modificare le quote nella console Google Cloud .
Quote per i modelli ottimizzati
L'inferenza del modello ottimizzato condivide la stessa quota del modello di base. Non esiste una quota separata per l'inferenza del modello ottimizzato.
Limiti di incorporamento
Le richieste pergemini-embedding-001 e gemini-embedding-2 sono soggette a quote globali.
| Modello di base | Quota | Metrica |
|---|---|---|
| base_model: gemini-embedding | 100.000.000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding | 100.000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200.000.000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60.000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
Le richieste di gemini-embedding-001 che utilizzano l'API predict sono inoltre soggette alle seguenti quote:
| Modello di base | Quota | Metrica |
|---|---|---|
| base_model: N/A | 30.000 | aiplatform.googleapis.com/online_prediction_requests |
Quote di Agent Runtime
Le seguenti quote si applicano a Agent Runtime per un determinato progetto in ogni regione:| Descrizione | Quota | Metrica |
|---|---|---|
| Creare, eliminare o aggiornare le risorse di Agent Runtime al minuto | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| Creare, eliminare o aggiornare le sessioni di Agent Runtime al minuto | 100 | aiplatform.googleapis.com/session_write_requests |
| Recuperare, elencare o recuperare le sessioni di Agent Runtime al minuto | 10000 | aiplatform.googleapis.com/session_read_requests |
Query o StreamQuery minuti di Agent Runtime al
minuto
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| Aggiungi evento alle sessioni di Agent Runtime al minuto | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Numero massimo di risorse di Agent Runtime | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Crea, elimina o aggiorna le risorse di memoria di Agent Runtime al minuto | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| Recupera, elenca o recupera da Memory Bank di Agent Runtime al minuto | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| Richieste di esecuzione al minuto dell'ambiente sandbox (esecuzione di codice) | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| Entità Ambiente sandbox (esecuzione di codice) per regione | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| Richieste di scrittura al minuto per l'ambiente sandbox (esecuzione del codice) | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
Richieste di post dell'agente A2A come sendMessage e cancelTask al
minuto
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
Richieste get dell'agente A2A come getTask e getCard al minuto
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
Connessioni bidirezionali live simultanee che utilizzano l'API BidiStreamQuery al minuto
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
Quote per l'input multimodale
Le seguenti quote si applicano all'input multimodale per le richiestegenerateContent e streamGenerateContent per un determinato progetto in ogni regione. Ogni quota viene applicata per modello base e risoluzione. Gli stessi limiti
si applicano alle richieste gestite dall'endpoint globale, utilizzando la metrica
..._global corrispondente.
| Descrizione | Quota | Metrica |
|---|---|---|
| Generare richieste di contenuti con input di immagini al minuto per modello di base e risoluzione | 34.000.000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| Generare richieste di contenuti con input video al minuto per modello di base e risoluzione | 192.000.000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| Generare richieste di contenuti con input audio al minuto per modello di base e risoluzione | 11.000.000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| Richieste di generazione di contenuti con input di documenti al minuto per modello di base e risoluzione | 1.200.000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
Per richiedere un limite superiore per queste quote, contatta il team del tuo account Google Cloud. Non è possibile aumentare i limiti dalla console Google Cloud .
Inferenza batch
Le quote e i limiti per i job di inferenza batch sono gli stessi in tutte le regioni.Limiti dei job di inferenza batch simultanei per i modelli Gemini
Non esistono limiti di quota predefiniti per l'inferenza batch per i modelli Gemini. Il servizio batch fornisce invece l'accesso a un ampio pool condiviso di risorse, allocate dinamicamente in base alla disponibilità e alla domanda in tempo reale del modello per tutti i clienti. Quando più clienti sono attivi e hanno saturato la capacità del modello, le richieste batch potrebbero essere inserite in coda per capacità.Quote per job di inferenza batch simultanei per modelli non Gemini
La seguente tabella elenca le quote per il numero di job di inferenza batch simultanei, che non si applicano ai modelli Gemini:| Quota | Valore |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
Visualizza e modifica le quote nella console Google Cloud
Per visualizzare e modificare le quote nella console Google Cloud :- Vai alla pagina Quote e limiti di sistema.
- Per modificare la quota, copia e incolla la proprietà
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsnel filtro. Premi Invio. - Fai clic sui tre puntini alla fine della riga e seleziona Modifica quota.
- Inserisci un nuovo valore di quota nel riquadro e fai clic su Invia richiesta.
Vai a Quote e limiti di sistema
Quote delle norme di governance semantica
Le seguenti quote si applicano alle norme di governance semantica per un determinato progetto in ogni regione:| Descrizione | Quota | Metrica |
|---|---|---|
| Recupera o elenca le norme di governance semantica al minuto | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| Creare, aggiornare o eliminare risorse delle norme di governance semantica al minuto | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| Richieste al minuto per le risorse del motore di policy di governance semantica | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| Aggiorna o deprovisiona le risorse del motore delle norme di governance semantica al minuto | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| Numero di risorse di norme di governance semantica per progetto per località. | 1000 | aiplatform.googleapis.com/semantic_governance/policy_count |
Visualizza e modifica le quote nella console Google Cloud
Per visualizzare e modificare le quote nella console Google Cloud :- Vai alla pagina Quote e limiti di sistema.
- Per modificare la quota, copia e incolla la proprietà
aiplatform.googleapis.com/semantic_governance/policy_write_requestsnel filtro. Premi Invio. - Fai clic sui tre puntini alla fine della riga e seleziona Modifica quota.
- Inserisci un nuovo valore di quota nel riquadro e fai clic su Invia richiesta.
Vai a Quote e limiti di sistema
Motore RAG su Gemini Enterprise Agent Platform
Per ogni servizio che esegue la generazione RAG (Retrieval-Augmented Generation) utilizzando RAG Engine, si applicano le seguenti quote, con la quota misurata come richieste al minuto (RPM).| Servizio | Quota | Metrica |
|---|---|---|
| API di gestione dei dati di RAG Engine | 60 giri/minuto | VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 giri/minuto | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1500 giri/minuto | Online prediction requests per base model per minute per region per base_modelUn altro filtro che puoi specificare è base_model: textembedding-gecko |
| Servizio | Limite | Metrica |
|---|---|---|
Richieste simultanee ImportRagFiles |
3 RPM | VertexRagService concurrent import requests per region |
Numero massimo di file per richiesta ImportRagFiles |
10.000 | VertexRagService import rag files requests per region |
Gen AI evaluation service
Gen AI evaluation service utilizza Gemini 2.5 Flash come modello di giudice predefinito per le metriche basate su modelli. Una singola richiesta di valutazione per una metrica basata su modello potrebbe generare più richieste sottostanti al Gen AI evaluation service. Il consumo di ciascun modello viene calcolato a livello di organizzazione, il che significa che tutte le richieste indirizzate al modello di valutazione per l'inferenza e la valutazione basata sul modello contribuiscono al consumo del modello. Le quote per Gen AI evaluation service e il modello di valutazione sottostante sono mostrate nella tabella seguente:| Richiedi quota | Quota predefinita |
|---|---|
| Richieste di Gen AI evaluation service al minuto | 1000 richieste per progetto per regione |
| Throughput di Gemini | Dipende dal modello e dall'opzione di consumo |
| Esecuzioni valutazione simultanee | 20 esecuzioni di valutazione simultanee per progetto per regione |
Se ricevi un errore relativo alle quote durante l'utilizzo del servizio di valutazione dell'IA generativa, potresti dover presentare una richiesta di aumento della quota. Per saperne di più, consulta Visualizzare e gestire le quote.
| Limite | Valore |
|---|---|
| Timeout della richiesta di servizio di Gen AI evaluation service | 60 secondi |
Quando utilizzi il servizio di valutazione dell'IA generativa per la prima volta in un nuovo progetto, potresti riscontrare un ritardo iniziale di configurazione fino a due minuti. Se la prima richiesta non va a buon fine, attendi qualche minuto e riprova. Le successive richieste di valutazione vengono in genere completate entro 60 secondi.
Il numero massimo di token di input e output per le metriche basate su modelli dipende dal modello utilizzato come modello giudice. Consulta Modelli Google per un elenco di modelli.
Quote di Gemini Enterprise Agent Platform Pipelines
Ogni job di ottimizzazione utilizza le pipeline di Gemini Enterprise Agent Platform. Per maggiori informazioni, consulta Quote e limiti di Agent Platform Pipelines.
Passaggi successivi
Standard PayGo
Scopri di più su Standard PayGo, un'opzione di consumo di Agent Platform che ti consente di pagare solo le risorse che utilizzi, senza richiedere impegni finanziari iniziali.
Quote e limiti di sistema di Agent Platform
Quote e limiti di sistema relativi ad Agent Platform, esclusi quelli specifici per prodotto.
Quote di Google Cloud
Scopri in che modo Google Cloud limita la quantità di una risorsa che può essere utilizzata nel tuo progetto Google Cloud e come le quote si applicano a una serie di tipi di risorse, inclusi hardware, software e componenti di rete.