Kontingente und Systemlimits für generative KI auf der Gemini Enterprise Agent Platform

Auf dieser Seite finden Sie eine Liste der Kontingente nach Region und Modell sowie Informationen zum Aufrufen und Bearbeiten Ihrer Kontingente in der Google Cloud Console.

Kontingente für abgestimmte Modelle

Für die Inferenz von abgestimmten Modellen gilt dasselbe Kontingent wie für das Basismodell. Es gibt kein separates Kontingent für die Inferenz von abgestimmten Modellen.

Limits für Einbettungen

Für Anfragen an gemini-embedding-001 gelten regionale Kontingente, während für Anfragen an gemini-embedding-2 globale Kontingente gelten.
Basismodell Quota Messwert
base_model: gemini-embedding 5.000.000 aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 10.000.000 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 40.000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model

Für Anfragen an gemini-embedding-001 mit der predict-API gelten außerdem die folgenden Kontingente:

Basismodell Quota Messwert
base_model: gemini-embedding 100.000 aiplatform.googleapis.com/online_prediction_requests_per_base_model
base_model: N/A 30.000 aiplatform.googleapis.com/online_prediction_requests

Kontingente für Agent Runtime

Die folgenden Kontingente gelten für Agent Runtime für ein bestimmtes Projekt in jeder Region:
Beschreibung Quota Messwert
Agent Runtime-Ressourcen pro Minute erstellen, löschen oder aktualisieren 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
Agent Runtime-Sitzungen pro Minute erstellen, löschen oder aktualisieren 100 aiplatform.googleapis.com/session_write_requests
Agent Runtime-Sitzungen pro Minute abrufen oder auflisten 10000 aiplatform.googleapis.com/session_read_requests
Agent Runtime pro Minute Query oder StreamQuery 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
Ereignis pro Minute an Agent Runtime-Sitzungen anhängen 300 aiplatform.googleapis.com/session_event_append_requests
Maximale Anzahl von Agent Runtime-Ressourcen 100 aiplatform.googleapis.com/reasoning_engine_service_entities
Agent Runtime-Speicherressourcen pro Minute erstellen, löschen oder aktualisieren 100 aiplatform.googleapis.com/memory_bank_write_requests
Pro Minute aus der Agent Runtime Memory Bank abrufen oder auflisten 300 aiplatform.googleapis.com/memory_bank_read_requests
Sandbox-Umgebung (Codeausführung): Anfragen pro Minute ausführen 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
Sandbox-Umgebung (Codeausführung): Entitäten pro Region 1000 aiplatform.googleapis.com/sandbox_environment_entities
Sandbox-Umgebung (Codeausführung): Schreibanfragen pro Minute 500 aiplatform.googleapis.com/sandbox_environment_write_requests
A2A-Agent-Post-Anfragen wie sendMessage und cancelTask pro Minute 60 aiplatform.googleapis.com/a2a_agent_post_requests
A2A-Agent-Get-Anfragen wie getTask und getCard pro Minute 600 aiplatform.googleapis.com/a2a_agent_get_requests
Gleichzeitige bidirektionale Live-Verbindungen mit der BidiStreamQuery API pro Minute 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

Batchinferenz

Die Kontingente und Limits für Batchinferenzjobs sind in allen Regionen gleich.

Limits für gleichzeitige Batchinferenzjobs für Gemini-Modelle

Für die Batchinferenz für Gemini-Modelle gibt es keine vordefinierten Kontingentlimits. Stattdessen bietet der Batchdienst Zugriff auf einen großen, gemeinsam genutzten Ressourcenpool, der dynamisch basierend auf der Echtzeitverfügbarkeit des Modells und der Nachfrage aller Kunden nach diesem Modell zugewiesen wird. Wenn mehr Kunden aktiv sind und die Kapazität des Modells gesättigt ist, werden Ihre Batchanfragen möglicherweise in die Warteschlange gestellt.

Kontingente für gleichzeitige Batchinferenzjobs für Nicht-Gemini-Modelle

In der folgenden Tabelle sind die Kontingente für die Anzahl der gleichzeitigen Batchinferenzjobs aufgeführt, die nicht für Gemini-Modelle gelten:
Quota Wert
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs 4
Wenn die Anzahl der eingereichten Aufgaben das zugewiesene Kontingent überschreitet, werden die Aufgaben in eine Warteschlange gestellt und verarbeitet, sobald Kontingentkapazität verfügbar ist.

Kontingente in der Google Cloud Console aufrufen und bearbeiten

So rufen Sie die Kontingente in der Google Cloud Console auf und bearbeiten sie:
  1. Rufen Sie die Seite Kontingente und Systemlimits auf.
  2. Seite „Kontingente und Systemlimits“ aufrufen

  3. Wenn Sie das Kontingent anpassen möchten, kopieren Sie die Property aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs und fügen Sie sie in das Feld Filter ein. Drücken Sie die Eingabetaste.
  4. Klicken Sie auf das Dreipunkt-Menü am Ende der Zeile und wählen Sie Kontingent bearbeiten aus.
  5. Geben Sie im Bereich einen neuen Kontingentwert ein und klicken Sie auf Anfrage senden.

Kontingente für Richtlinien für semantische Governance

Die folgenden Kontingente gelten für Richtlinien für semantische Governance für ein bestimmtes Projekt in jeder Region:
Beschreibung Quota Messwert
Richtlinienressourcen für Richtlinien für semantische Governance pro Minute abrufen oder auflisten 600 aiplatform.googleapis.com/semantic_governance/policy_read_requests
Richtlinienressourcen für Richtlinien für semantische Governance pro Minute erstellen, aktualisieren oder löschen 60 aiplatform.googleapis.com/semantic_governance/policy_write_requests
Ressourcen der Richtlinien für semantische Governance pro Minute abrufen 600 aiplatform.googleapis.com/semantic_governance/engine_read_requests
Ressourcen der Richtlinien für semantische Governance pro Minute aktualisieren oder bereitstellen 60 aiplatform.googleapis.com/semantic_governance/engine_write_requests
Anzahl der Ressourcen für Richtlinien für semantische Governance pro Projekt und Standort 1.000 aiplatform.googleapis.com/semantic_governance/policy_count

Kontingente in der Google Cloud Console aufrufen und bearbeiten

So rufen Sie die Kontingente in der Google Cloud Console auf und bearbeiten sie:
  1. Rufen Sie die Seite Kontingente und Systemlimits auf.
  2. Seite „Kontingente und Systemlimits“ aufrufen

  3. Wenn Sie das Kontingent anpassen möchten, kopieren Sie die Property aiplatform.googleapis.com/semantic_governance/policy_write_requests und fügen Sie sie in das Feld Filter ein. Drücken Sie die Eingabetaste.
  4. Klicken Sie auf das Dreipunkt-Menü am Ende der Zeile und wählen Sie Kontingent bearbeiten aus.
  5. Geben Sie im Bereich einen neuen Kontingentwert ein und klicken Sie auf Anfrage senden.

RAG Engine auf der Gemini Enterprise Agent Platform

Für jeden Dienst, der RAG (Retrieval-Augmented Generation) mit der RAG Engine ausführt, gelten die folgenden Kontingente. Das Kontingent wird als Anfragen pro Minute (Requests per Minute, RPM) gemessen.
Dienst Quota Messwert
RAG Engine-APIs für die Datenverwaltung 60 RPM VertexRagDataService requests per minute per region
RetrievalContexts-API 600 RPM VertexRagService retrieve requests per minute per region
base_model: textembedding-gecko 1.500 RPM Online prediction requests per base model per minute per region per base_model

Ein zusätzlicher Filter, den Sie angeben können, ist base_model: textembedding-gecko
Die folgenden Begrenzungen gelten:
Dienst Limit Messwert
Gleichzeitige ImportRagFiles-Anfragen 3 RPM VertexRagService concurrent import requests per region
Maximale Anzahl von Dateien pro ImportRagFiles-Anfrage 10.000 VertexRagService import rag files requests per region

Weitere Ratenlimits und Kontingente finden Sie unter Generative KI auf der Gemini Enterprise Agent Platform Ratenlimits.

Gen AI Evaluation Service

Der Gen AI Evaluation Service verwendet Gemini 2.5 Flash als Standardmodell für modellbasierte Messwerte. Eine einzelne Bewertungsanfrage für einen modellbasierten Messwert kann zu mehreren zugrunde liegenden Anfragen an den Gen AI Evaluation Service führen. Der Verbrauch jedes Modells wird auf Organisationsebene berechnet. Das bedeutet, dass alle Anfragen, die zur Modellinferenz und zur modellbasierten Bewertung an das Bewertungsmodell gerichtet werden, zum Verbrauch des Modells beitragen. Die Kontingente für den Gen AI Evaluation Service und das zugrunde liegende Bewertungsmodell sind in der folgenden Tabelle aufgeführt:
Anfragekontingent Standardkontingent
Anfragen pro Minute an den Gen AI Evaluation Service 1.000 Anfragen pro Projekt und Region
Gemini-Durchsatz Abhängig vom Modell und der Verbrauchsoption
Gleichzeitige Bewertungsausführungen 20 gleichzeitige Bewertungsausführungen pro Projekt und Region

Wenn bei der Verwendung des Gen AI Evaluation Service ein Fehler im Zusammenhang mit Kontingenten auftritt, müssen Sie möglicherweise eine Anfrage zur Kontingenterhöhung einreichen. Weitere Informationen finden Sie unter Kontingente aufrufen und verwalten.

Limit Wert
Timeout für Anfragen an den Gen AI Evaluation Service 60 Sekunden

Wenn Sie den Gen AI Evaluation Service zum ersten Mal in einem neuen Projekt verwenden, kann es zu einer anfänglichen Einrichtungsverzögerung von bis zu zwei Minuten kommen. Wenn Ihre erste Anfrage fehlschlägt, warten Sie einige Minuten und versuchen Sie es dann noch einmal. Nachfolgende Bewertungsanfragen werden in der Regel innerhalb von 60 Sekunden abgeschlossen.

Die maximalen Eingabe- und Ausgabetokens für modellbasierte Messwerte hängen vom Modell ab, das als Bewertungsmodell verwendet wird. Eine Liste der Modelle finden Sie unter Google-Modelle für eine Liste der Modelle.

Kontingente für Gemini Enterprise Agent Platform Pipelines

Jeder Abstimmungsjob verwendet Gemini Enterprise Agent Platform Pipelines. Weitere Informationen finden Sie unter Kontingente und Limits für Agent Platform Pipelines.

Nächste Schritte

Übersicht

Informationen zu Standard-Pay-as-you-go, einer Verbrauchsoption für die Agent Platform, mit der Sie nur für die Ressourcen bezahlen, die Sie verbrauchen, ohne dass Vorabverpflichtungen erforderlich sind.

Ressource

Kontingente und Systemlimits im Zusammenhang mit der Agent Platform, ausgenommen produktspezifische Kontingente und Systemlimits.

Übersicht

Informationen dazu, wie Google Cloud einschränkt, wie viel von einer Ressource Ihr Google Cloud-Projekt nutzen kann, und wie Kontingente für eine Reihe von Ressourcentypen gelten, einschließlich Hardware-, Software- und Netzwerkkomponenten.