Quote e limiti di sistema per gli agenti in Agent Platform

Questo documento elenca le quote e i limiti di sistema che si applicano a Gemini Enterprise Agent Platform.

  • Le quote hanno valori predefiniti, ma in genere puoi richiedere degli adeguamenti.
  • I limiti di sistema sono valori fissi che non possono essere modificati.

Google Cloud utilizza le quote per garantire l'equità e ridurre i picchi di utilizzo e disponibilità delle risorse. Una quota limita la quantità di una Google Cloud risorsa che Google Cloud il progetto può utilizzare. Le quote si applicano a una serie di tipi di risorse, inclusi hardware, software e componenti di rete. Ad esempio, le quote possono limitare il numero di chiamate API a un servizio, il numero di bilanciatori del carico utilizzati contemporaneamente dal tuo progetto o il numero di progetti che puoi creare. Le quote proteggono la community degli utentiGoogle Cloud impedendo il sovraccarico dei servizi. Le quote ti aiutano inoltre a gestire le tue Google Cloud risorse.

Il sistema delle quote di Cloud esegue le seguenti operazioni:

Nella maggior parte dei casi, quando provi a utilizzare una risorsa per un volume maggiore di quello consentito dalla quota, il sistema blocca l'accesso alla risorsa e l'attività che stai tentando di eseguire non va a buon fine.

In genere, le quote si applicano a livello di Google Cloud progetto. L'utilizzo di una risorsa in un progetto non influisce sulla quota disponibile in un altro progetto. All'interno di un progetto Google Cloud , le quote vengono condivise tra tutte le applicazioni e gli indirizzi IP.

Per saperne di più, consulta la Panoramica delle quote di Cloud.

Quote

Le seguenti quote si applicano agli agenti di cui è stato eseguito il deployment su Agent Platform per un determinato progetto in ogni regione:

Descrizione Quota Metrica
Crea, elimina o aggiorna le risorse di Agent Platform al minuto 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
Crea, elimina o aggiorna le risorse non regionali (globali o multiregionali) di Agent Platform al minuto 10 aiplatform.googleapis.com/non_regional_reasoning_engine_service_write_requests
Crea, elimina o aggiorna le sessioni di Agent Platform al minuto 100 aiplatform.googleapis.com/session_write_requests
Esegui Query o StreamQuery su Agent Platform al minuto 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
Aggiungi un evento alle sessioni di Agent Platform al minuto 300 aiplatform.googleapis.com/session_event_append_requests
Crea, elimina o aggiorna le sessioni non regionali (globali o multiregionali) di Agent Platform al minuto 100 aiplatform.googleapis.com/non_regional_session_write_requests
Aggiungi un evento alle sessioni non regionali (globali o multiregionali) di Agent Platform al minuto 300 aiplatform.googleapis.com/non_regional_session_event_append_requests
Numero massimo di risorse di Agent Platform 100 aiplatform.googleapis.com/reasoning_engine_service_entities
Numero massimo di risorse non regionali (globali o multiregionali) di Agent Platform 100 aiplatform.googleapis.com/non_regional_reasoning_engine_service_entities
Crea, elimina o aggiorna le risorse di memoria di Agent Platform al minuto 100 aiplatform.googleapis.com/memory_bank_write_requests
Recupera, elenca o recupera da Agent Platform Memory Bank al minuto 300 aiplatform.googleapis.com/memory_bank_read_requests
Crea, elimina o aggiorna le risorse di memoria non regionali (globali o multiregionali) di Agent Platform al minuto 100 aiplatform.googleapis.com/non_regional_memory_bank_write_requests
Recupera, elenca o recupera da Agent Platform Memory Bank non regionale (globale o multiregionale) al minuto 300 aiplatform.googleapis.com/non_regional_memory_bank_read_requests
Richieste di esecuzione dell'ambiente sandbox (esecuzione del codice) al minuto 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
Entità dell'ambiente sandbox (esecuzione del codice) per regione 1000 aiplatform.googleapis.com/sandbox_environment_entities
Richieste di scrittura dell'ambiente sandbox (esecuzione del codice) al minuto 500 aiplatform.googleapis.com/sandbox_environment_write_requests
Richieste di post dell'agente A2A come sendMessage e cancelTask al minuto 60 aiplatform.googleapis.com/a2a_agent_post_requests
Richieste di get dell'agente A2A come getTask e getCard al minuto 600 aiplatform.googleapis.com/a2a_agent_get_requests
Connessioni bidirezionali live simultanee che utilizzano l'API BidiStreamQuery al minuto 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

Gestione delle quote per i carichi di produzione

Man mano che il traffico aumenta, è probabile che tu debba richiedere aumenti per quote API di Agent Platform specifiche per evitare errori 429 Resource Exhausted. Puoi configurare in modo proattivo il runtime e aumentare le quote per mantenere l'istanza di Agent Runtime reattiva, scalabile e affidabile con il carico di produzione.

Per informazioni su come ottimizzare e scalare il rendimento di Agent Runtime, consulta Ottimizzare e scalare il rendimento di Agent Runtime performance.

Per stimare i requisiti di quota di picco, segui questi passaggi:

  1. Definisci le variabili:

    • U: utenti simultanei di picco (ad esempio 250).

    • X: richieste medie per utente al minuto (ad esempio 2).

    • Y: eventi di sessione medi generati per richiesta (ad esempio 12 per una catena complessa che coinvolge più chiamate allo strumento).

  2. Calcola il carico di picco:

    • Calcola le query di picco al minuto (QPM): U * X

    • Calcola gli eventi di sessione di picco al minuto: QPM di picco * Y

  3. Richiedi una quota con un buffer: quando richiedi un aumento della quota, aggiungi un buffer (ad esempio il 50%) al picco calcolato per gestire picchi imprevisti.

La seguente tabella mostra i calcoli per le quote principali relative al rendimento di Agent Platform, utilizzando le variabili di esempio peak concurrent users=250, average requests per user per minute=2, e average session events generated per request=12:

Nome quota Descrizione della quota Calcolo di base (picco) Valore consigliato (con buffer del 50%)
Esegui query su Agent Engine al minuto (aiplatform.googleapis.com/reasoning_engine_service_query_requests) Il numero totale di query o stream_query chiamate che l'agente può ricevere al minuto. 250 users * 2 req/min = 500 QPM 500 * 1.5 = 750
Aggiungi eventi di sessione al minuto (aiplatform.googleapis.com/session_event_append_requests)

Il numero di turni o eventi in tutte le sessioni in corso. Una singola query può generare più eventi di sessione in una catena, per esempio:

  1. Chiama LLM.
  2. Risposta LLM: usa lo strumento.
  3. Esegui lo strumento.
  4. Chiama LLM con la risposta dello strumento.
  5. LLM fornisce la risposta finale.
500 QPM * 12 events/req = 6,000 6,000 * 1.5 = 9,000
Scritture di sessione al minuto (aiplatform.googleapis.com/session_write_requests) La frequenza di creazione o aggiornamento delle risorse di sessione. In genere è minore o uguale alla frequenza delle query. In genere <= QPM di picco (500) In genere <= quota di query (750)

Richiedi un aggiustamento delle quote

Per modificare la maggior parte delle quote, utilizza la Google Cloud console. Per ulteriori informazioni, consulta Richiedi un aggiustamento delle quote.

Quote della modalità express di Agent Platform

Gli utenti della modalità express del livello senza costi di Agent Platform hanno le seguenti quote per i servizi di Agent Platform senza costi. Per ulteriori informazioni sul Livello senza costi e sulla modalità express, consulta la panoramica di Agent Platform in modalità express.

Le seguenti quote si applicano agli agenti di cui è stato eseguito il deployment su Agent Platform per un determinato progetto in modalità express in ogni regione:

Descrizione Quota Metrica
Numero massimo di risorse di Agent Platform 10 aiplatform.googleapis.com/reasoning_engine_service_entities
Crea, elimina o aggiorna le risorse di Agent Platform al minuto 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
Esegui Query o StreamQuery su Agent Platform al minuto 10 aiplatform.googleapis.com/reasoning_engine_service_query_requests
Connessioni bidirezionali live simultanee che utilizzano l'API BidiStreamQuery al minuto 1 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
Crea, elimina o aggiorna le sessioni di Agent Platform al minuto 10 aiplatform.googleapis.com/session_write_requests
Aggiungi un evento alle sessioni di Agent Platform al minuto 30 aiplatform.googleapis.com/session_event_append_requests
Crea, elimina o aggiorna le risorse di memoria di Agent Platform al minuto 10 aiplatform.googleapis.com/memory_bank_write_requests
Recupera, elenca o recupera da Memory Bank al minuto 10 aiplatform.googleapis.com/memory_bank_read_requests