Auf dieser Seite finden Sie eine Liste der Kontingente nach Region und Modell sowie Informationen zum Aufrufen und Bearbeiten Ihrer Kontingente in der Google Cloud Console.
Kontingente für abgestimmte Modelle
Für die Inferenz von abgestimmten Modellen gilt dasselbe Kontingent wie für das Basismodell. Es gibt kein separates Kontingent für die Inferenz von abgestimmten Modellen.
Limits für Einbettungen
Für Anfragen fürgemini-embedding-001 und gemini-embedding-2 gelten globale Kontingente.
| Basismodell | Quota | Messwert |
|---|---|---|
| base_model: gemini-embedding | 100.000.000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding | 100.000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200.000.000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60.000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
Für Anfragen für gemini-embedding-001 mit der predict-API gelten außerdem die folgenden Kontingente:
| Basismodell | Quota | Messwert |
|---|---|---|
| base_model: N/A | 30.000 | aiplatform.googleapis.com/online_prediction_requests |
Kontingente für Agent Runtime
Die folgenden Kontingente gelten für Agent Runtime für ein bestimmtes Projekt in jeder Region:| Beschreibung | Quota | Messwert |
|---|---|---|
| Agent Runtime-Ressourcen pro Minute erstellen, löschen oder aktualisieren | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| Agent Runtime-Sitzungen pro Minute erstellen, löschen oder aktualisieren | 100 | aiplatform.googleapis.com/session_write_requests |
| Agent Runtime-Sitzungen pro Minute abrufen, auflisten oder wiederherstellen | 10000 | aiplatform.googleapis.com/session_read_requests |
Query oder StreamQuery Agent Runtime pro
Minute
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| Ereignis an Agent Runtime-Sitzungen pro Minute anhängen | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Maximale Anzahl von Agent Runtime-Ressourcen | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Agent Runtime-Speicherressourcen pro Minute erstellen, löschen oder aktualisieren | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| Pro Minute aus der Agent Runtime Memory Bank abrufen, auflisten oder wiederherstellen | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| Anfragen für die Ausführung in der Sandbox-Umgebung (Codeausführung) pro Minute | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| Entitäten in der Sandbox-Umgebung (Codeausführung) pro Region | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| Schreibanfragen in der Sandbox-Umgebung (Codeausführung) pro Minute | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
A2A-Agent-Post-Anfragen wie sendMessage und cancelTask pro
Minute
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
A2A-Agent-Get-Anfragen wie getTask und getCard pro Minute
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
Gleichzeitige bidirektionale Live-Verbindungen mit der BidiStreamQuery API pro
Minute
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
Kontingente für multimodale Eingaben
Die folgenden Kontingente gelten für multimodale Eingaben fürgenerateContent- und streamGenerateContent-Anfragen für ein bestimmtes Projekt in jeder Region. Jedes Kontingent wird pro Basismodell und Auflösung erzwungen. Für Anfragen, die vom globalen Endpunkt verarbeitet werden, gelten dieselben Limits. Dabei wird der entsprechende ..._global-Messwert verwendet.
| Beschreibung | Quota | Messwert |
|---|---|---|
| Anfragen zum Generieren von Inhalten mit Bildeingabe pro Minute und Basismodell und Auflösung | 34.000.000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| Anfragen zum Generieren von Inhalten mit Videoeingabe pro Minute und Basismodell und Auflösung | 192.000.000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| Anfragen zum Generieren von Inhalten mit Audioeingabe pro Minute und Basismodell und Auflösung | 11.000.000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| Anfragen zum Generieren von Inhalten mit Dokumenteingabe pro Minute und Basismodell und Auflösung | 1.200.000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
Wenn Sie ein höheres Limit für diese Kontingente anfordern möchten, wenden Sie sich an Ihr Google Cloud-Kontoteam . Die Kontingente können nicht über die Google Cloud Console erhöht werden.
Batchinferenz
Die Kontingente und Limits für Batchinferenzjobs sind in allen Regionen gleich.Limits für gleichzeitige Batchinferenzjobs für Gemini-Modelle
Für die Batchinferenz für Gemini-Modelle gibt es keine vordefinierten Kontingentlimits. Stattdessen bietet der Batchdienst Zugriff auf einen großen, gemeinsam genutzten Ressourcenpool, der dynamisch basierend auf der Echtzeitverfügbarkeit des Modells und der Nachfrage aller Kunden nach diesem Modell zugewiesen wird. Wenn mehr Kunden aktiv sind und die Kapazität des Modells ausgelastet ist, werden Ihre Batchanfragen möglicherweise in die Warteschlange gestellt.Kontingente für gleichzeitige Batchinferenzjobs für andere Modelle als Gemini-Modelle
In der folgenden Tabelle sind die Kontingente für die Anzahl der gleichzeitigen Batchinferenzjobs aufgeführt, die nicht für Gemini-Modelle gelten:| Quota | Wert |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
Kontingente in der Google Cloud Console aufrufen und bearbeiten
So rufen Sie die Kontingente in der Google Cloud Console auf und bearbeiten sie:- Rufen Sie die Seite Kontingente und Systemlimits auf.
- Wenn Sie das Kontingent anpassen möchten, kopieren Sie die Property
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsund fügen Sie sie in das Feld Filter ein. Drücken Sie die Eingabetaste. - Klicken Sie am Ende der Zeile auf das Dreipunkt-Menü und wählen Sie Kontingent bearbeiten aus.
- Geben Sie im Bereich einen neuen Kontingentwert ein und klicken Sie auf Anfrage senden.
Seite „Kontingente und Systemlimits“ aufrufen
Kontingente für Richtlinien für semantische Governance
Die folgenden Kontingente gelten für Richtlinien für semantische Governance für ein bestimmtes Projekt in jeder Region:| Beschreibung | Quota | Messwert |
|---|---|---|
| Ressourcen für Richtlinien für semantische Governance pro Minute abrufen oder auflisten | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| Ressourcen für Richtlinien für semantische Governance pro Minute erstellen, aktualisieren oder löschen | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| Ressourcen für die Engine für Richtlinien für semantische Governance pro Minute abrufen | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| Ressourcen für die Engine für Richtlinien für semantische Governance pro Minute aktualisieren oder bereitstellen | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| Anzahl der Ressourcen für Richtlinien für semantische Governance pro Projekt und Standort | 1.000 | aiplatform.googleapis.com/semantic_governance/policy_count |
Kontingente in der Google Cloud Console aufrufen und bearbeiten
für Ihr Projekt aktiviert haben. Wenn die API nicht aktiviert ist, werden die Agent Platform-Kontingente nicht angezeigt. So rufen Sie die Kontingente in der Google Cloud Console auf und bearbeiten sie:- Rufen Sie die Seite Kontingente und Systemlimits auf.
- Wenn Sie das Kontingent anpassen möchten, kopieren Sie die Property
aiplatform.googleapis.com/semantic_governance/policy_write_requestsund fügen Sie sie in das Feld Filter ein. Drücken Sie die Eingabetaste. - Klicken Sie am Ende der Zeile auf das Dreipunkt-Menü und wählen Sie Kontingent bearbeiten aus.
- Geben Sie im Bereich einen neuen Kontingentwert ein und klicken Sie auf Anfrage senden.
Seite „Kontingente und Systemlimits“ aufrufen
RAG Engine auf der Gemini Enterprise Agent Platform
Für jeden Dienst, der RAG (Retrieval-Augmented Generation) mit der RAG Engine ausführt, gelten die folgenden Kontingente. Das Kontingent wird als Anfragen pro Minute (Requests Per Minute, RPM) gemessen.| Dienst | Quota | Messwert |
|---|---|---|
| APIs für die Datenverwaltung der RAG Engine | 60 RPM | VertexRagDataService requests per minute per region |
RetrievalContexts-API |
600 RPM | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1.500 RPM | Online prediction requests per base model per minute per region per base_modelEin weiterer Filter, den Sie angeben können, ist base_model: textembedding-gecko |
| Dienst | Limit | Messwert |
|---|---|---|
Gleichzeitige ImportRagFiles-Anfragen |
3 RPM | VertexRagService concurrent import requests per region |
Maximale Anzahl von Dateien pro ImportRagFiles-Anfrage |
10.000 | VertexRagService import rag files requests per region |
Gen AI Evaluation Service
Der Gen AI Evaluation Service verwendet Gemini 2.5 Flash als Standardmodell für die Bewertung modellbasierter Messwerte. Eine einzelne Bewertungsanfrage für einen modellbasierten Messwert kann zu mehreren zugrunde liegenden Anfragen an den Gen AI Evaluation Service führen. Der Verbrauch jedes Modells wird auf Organisationsebene berechnet. Das bedeutet, dass alle Anfragen, die zur Modellinferenz und zur modellbasierten Bewertung an das Bewertungsmodell gerichtet werden, zum Verbrauch des Modells beitragen. Die Kontingente für den Gen AI Evaluation Service und das zugrunde liegende Bewertungsmodell sind in der folgenden Tabelle aufgeführt:| Anfragekontingent | Standardkontingent |
|---|---|
| Anfragen an den Gen AI Evaluation Service pro Minute | 1.000 Anfragen pro Projekt und Region |
| Gemini-Durchsatz | Abhängig vom Modell und der Verbrauchsoption |
| Gleichzeitige Bewertungsausführungen | 20 gleichzeitige Bewertungsausführungen pro Projekt und Region |
Wenn bei der Verwendung des Gen AI Evaluation Service ein Fehler im Zusammenhang mit Kontingenten auftritt, müssen Sie möglicherweise eine Anfrage zur Kontingenterhöhung einreichen. Weitere Informationen finden Sie unter Kontingente aufrufen und verwalten.
| Limit | Wert |
|---|---|
| Timeout für Anfragen an den Gen AI Evaluation Service | 60 Sekunden |
Wenn Sie den Gen AI Evaluation Service zum ersten Mal in einem neuen Projekt verwenden, kann es bis zu zwei Minuten dauern, bis die Einrichtung abgeschlossen ist. Wenn Ihre erste Anfrage fehlschlägt, warten Sie einige Minuten und versuchen Sie es dann noch einmal. Nachfolgende Bewertungsanfragen werden in der Regel innerhalb von 60 Sekunden abgeschlossen.
Die maximalen Eingabe- und Ausgabetokens für modellbasierte Messwerte hängen vom Modell ab, das als Bewertungsmodell verwendet wird. Eine Liste der Modelle finden Sie unter Google-Modelle für eine Liste der Modelle.
Kontingente für Gemini Enterprise Agent Platform Pipelines
Jeder Abstimmungsjob verwendet Gemini Enterprise Agent Platform Pipelines. Weitere Informationen finden Sie unter Kontingente und Limits für Agent Platform Pipelines.
Nächste Schritte
Standard-Pay-as-you-go
Informationen zu Standard-Pay-as-you-go, einer Verbrauchsoption für die Agent Platform, mit der Sie nur für die Ressourcen bezahlen, die Sie verbrauchen, ohne dass Vorabverpflichtungen erforderlich sind.
Kontingente und Systemlimits für die Agent Platform
Kontingente und Systemlimits im Zusammenhang mit der Agent Platform, mit Ausnahme produktspezifischer Kontingente und Systemlimits.
Google Cloud-Kontingente
Informationen dazu, wie Google Cloud einschränkt, wie viel von einer Ressource Ihr Google Cloud-Projekt nutzen kann, und wie Kontingente für eine Reihe von Ressourcentypen gelten, einschließlich Hardware, Software und Netzwerkkomponenten.