In diesem Dokument sind die Kontingente und Systemlimits für Gemini Enterprise Agent Platform aufgeführt.
- Kontingente haben Standardwerte, aber Sie können in der Regel Anpassungen anfordern.
- Systemlimits sind feste Werte, die nicht geändert werden können.
Google Cloud nutzt Kontingente, um für Fairness zu sorgen und Spitzen bei der Ressourcennutzung und ‑verfügbarkeit zu reduzieren. Ein Kontingent schränkt ein, wie viel von einerGoogle Cloud Ressource Ihr Google Cloud Projekt nutzen kann. Kontingente gelten für eine Reihe von Ressourcentypen, einschließlich Hardware, Software und Netzwerkkomponenten. Mit Kontingenten können Sie beispielsweise die Anzahl der API-Aufrufe an einen Dienst, die Anzahl der von Ihrem Projekt nebenläufig verwendeten Load Balancer oder die Anzahl der Projekte begrenzen, die Sie erstellen können. Kontingente sollen eine Überlastung von Diensten verhindern und dadurch die Community derGoogle Cloud Nutzer schützen. Sie helfen Ihnen auch bei der Verwaltung Ihrer eigenen Google Cloud Ressourcen.
Das Cloud-Kontingentsystem tut Folgendes:
- Es überwacht Ihren Verbrauch von Google Cloud Produkten und Diensten.
- Es schränkt Ihren Verbrauch dieser Ressourcen ein.
- Es bietet eine Möglichkeit, Änderungen am Kontingentwert zu beantragen und Kontingentanpassungen zu automatisieren.
Wenn Sie versuchen, mehr von einer Ressource zu verbrauchen, als das Kontingent zulässt, blockiert das System in den meisten Fällen den Zugriff auf die Ressource. Die Aufgabe, die Sie auszuführen versuchen, schlägt dann fehl.
Kontingente gelten in der Regel auf Google Cloud Projektebene. Die Nutzung einer Ressource in einem Projekt hat keinen Einfluss auf das verfügbare Kontingent in einem anderen Projekt. Innerhalb eines Google Cloud Projekts werden die Kontingente für alle Anwendungen und IP-Adressen gemeinsam genutzt.
Weitere Informationen finden Sie unter dem Cloud-Kontingente – Übersicht.
Kontingente
Die folgenden Kontingente gelten für Agents, die in Agent Platform für ein bestimmtes Projekt in jeder Region bereitgestellt werden:
| Beschreibung | Quota | Messwert |
|---|---|---|
| Agent Platform-Ressourcen pro Minute erstellen, löschen oder aktualisieren | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| Nicht regionale (globale oder multiregionale) Agent Platform-Ressourcen pro Minute erstellen, löschen oder aktualisieren | 10 | aiplatform.googleapis.com/non_regional_reasoning_engine_service_write_requests |
| Agent Platform-Sitzungen pro Minute erstellen, löschen oder aktualisieren | 100 | aiplatform.googleapis.com/session_write_requests |
Query oder StreamQuery Agent Platform pro Minute |
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| Ereignis pro Minute an Agent Platform-Sitzungen anhängen | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Nicht regionale (globale oder multiregionale) Agent Platform-Sitzungen pro Minute erstellen, löschen oder aktualisieren | 100 | aiplatform.googleapis.com/non_regional_session_write_requests |
| Ereignis pro Minute an nicht regionale (globale oder multiregionale) Agent Platform-Sitzungen anhängen | 300 | aiplatform.googleapis.com/non_regional_session_event_append_requests |
| Maximale Anzahl von Agent Platform-Ressourcen | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Maximale Anzahl von nicht regionalen (globalen oder multiregionalen) Agent Platform-Ressourcen | 100 | aiplatform.googleapis.com/non_regional_reasoning_engine_service_entities |
| Agent Platform-Speicherressourcen pro Minute erstellen, löschen oder aktualisieren | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| Pro Minute aus der Agent Platform Memory Bank abrufen, auflisten oder wiederherstellen | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| Nicht regionale (globale oder multiregionale) Agent Platform-Speicherressourcen pro Minute erstellen, löschen oder aktualisieren | 100 | aiplatform.googleapis.com/non_regional_memory_bank_write_requests |
| Pro Minute aus der nicht regionalen (globalen oder multiregionalen) Agent Platform Memory Bank abrufen, auflisten oder wiederherstellen | 300 | aiplatform.googleapis.com/non_regional_memory_bank_read_requests |
| Sandbox-Umgebung (Codeausführung): Anfragen pro Minute ausführen | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| Sandbox-Umgebung (Codeausführung): Entitäten pro Region | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| Sandbox-Umgebung (Codeausführung): Schreibanfragen pro Minute | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
A2A-Agent-Post-Anfragen wie sendMessage und cancelTask pro Minute |
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
A2A-Agent-Get-Anfragen wie getTask und getCard pro Minute |
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
Gleichzeitige bidirektionale Live-Verbindungen mit der BidiStreamQuery API pro Minute |
10 | aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests |
Kontingentverwaltung für Produktionslasten
Wenn Ihr Traffic skaliert wird, müssen Sie möglicherweise Erhöhungen für bestimmte Agent Platform API-Kontingente anfordern, um 429 Resource Exhausted-Fehler zu vermeiden. Sie können
Ihre Laufzeit
proaktiv konfigurieren
und Ihre Kontingente erhöhen, damit Ihre
Agent Runtime-Instanz unter
Produktionslast reaktionsschnell, skalierbar und zuverlässig bleibt.
Informationen zum Optimieren und Skalieren der Leistung von Agent Runtime finden Sie unter Leistung von Agent Runtime optimieren und skalieren.
So schätzen Sie Ihre Spitzenkontingentanforderungen:
Definieren Sie Ihre Variablen:
U: Spitzenwert der gleichzeitigen Nutzer (z. B. 250)X: Durchschnittliche Anfragen pro Nutzer und Minute (z. B. 2)Y: Durchschnittliche Anzahl der Sitzungsereignisse pro Anfrage (z. B. 12 für eine komplexe Kette mit mehreren Toolaufrufen)
Berechnen Sie Ihre Spitzenlast:
Berechnen Sie die Spitzenanzahl der Abfragen pro Minute (QPM): U * X
Berechnen Sie die Spitzenanzahl der Sitzungsereignisse pro Minute: Spitzenwert der QPM * Y
Kontingent mit Puffer anfordern: Wenn Sie eine Kontingenterhöhung anfordern, fügen Sie einen Puffer (z. B. 50%) zu Ihrem berechneten Spitzenwert hinzu, um unerwartete Spitzen zu bewältigen.
In der folgenden Tabelle sind die Berechnungen für wichtige leistungsbezogene Kontingente für
Agent Platform mit den Beispielvariablen peak concurrent users=250,
average requests per user per minute=2 und average session events generated
per request=12 aufgeführt:
| Kontingentname | Kontingentbeschreibung | Basisberechnung (Spitzenwert) | Empfohlener Wert (mit 50% Puffer) |
|---|---|---|---|
Agent Engine pro Minute abfragen (aiplatform.googleapis.com/reasoning_engine_service_query_requests) |
Die Gesamtzahl der query- oder stream_query-Aufrufe, die Ihr Agent pro Minute empfangen kann. |
250 users * 2 req/min = 500 QPM |
500 * 1.5 = 750 |
Sitzungsereignisse pro Minute anhängen (aiplatform.googleapis.com/session_event_append_requests) |
Die Anzahl der Züge oder Ereignisse in allen laufenden Sitzungen. Eine einzelne Abfrage kann mehrere Sitzungsereignisse in einer Kette generieren, z. B.:
|
500 QPM * 12 events/req = 6,000 |
6,000 * 1.5 = 9,000 |
Sitzungsschreibvorgänge pro Minute (aiplatform.googleapis.com/session_write_requests) |
Die Rate zum Erstellen oder Aktualisieren von Sitzungsressourcen. Dieser Wert ist in der Regel kleiner oder gleich der Abfragerate. | In der Regel <= Spitzenwert der QPM (500) |
In der Regel <= Abfragekontingent (750) |
Kontingentanpassung anfordern
Die meisten Kontingente können Sie in der Google Cloud Console anpassen. Weitere Informationen finden Sie unter Kontingentanpassung anfordern.
Kontingente für den Expressmodus von Agent Platform
Nutzer der kostenlosen Stufe von Agent Platform im Expressmodus haben die folgenden Kontingente für Agent Platform-Dienste kostenlos: Weitere Informationen zum kostenlosen Tarif und zum Expressmodus finden Sie unter Agent Platform im Expressmodus – Übersicht.
Die folgenden Kontingente gelten für Agents, die in Agent Platform für ein bestimmtes Projekt im Expressmodus in jeder Region bereitgestellt werden:
| Beschreibung | Quota | Messwert |
|---|---|---|
| Maximale Anzahl von Agent Platform-Ressourcen | 10 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Agent Platform-Ressourcen pro Minute erstellen, löschen oder aktualisieren | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
Query oder StreamQuery Agent Platform pro Minute |
10 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
Gleichzeitige bidirektionale Live-Verbindungen mit der BidiStreamQuery API pro Minute |
1 | aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests |
| Agent Platform-Sitzungen pro Minute erstellen, löschen oder aktualisieren | 10 | aiplatform.googleapis.com/session_write_requests |
| Ereignis pro Minute an Agent Platform-Sitzungen anhängen | 30 | aiplatform.googleapis.com/session_event_append_requests |
| Agent Platform-Speicherressourcen pro Minute erstellen, löschen oder aktualisieren | 10 | aiplatform.googleapis.com/memory_bank_write_requests |
| Pro Minute aus der Memory Bank abrufen, auflisten oder wiederherstellen | 10 | aiplatform.googleapis.com/memory_bank_read_requests |