Priorisiertes „Pay as you go“ (priorisiertes PayGo) ist eine Nutzungsoption, die eine konsistentere Leistung als Standard-PayGo bietet, ohne dass eine Vorabzusicherung für bereitgestellten Durchsatz erforderlich ist.
Bei der Verwendung von priorisiertem PayGo wird die Nutzung von Tokens zu einem höheren Preis als bei Standard-PayGo in Rechnung gestellt. Informationen zu den Preisen finden Sie auf der Preisseite für die Gemini Enterprise Agent Platform.
Wann sollte Priority PayGo verwendet werden?
Priority PayGo ist ideal für geschäftskritische Arbeitslasten mit schwankenden oder unvorhersehbaren Traffic-Mustern. Beispiele:
- Virtuelle Assistenten für Kunden
- Agentische Workflows und agentenübergreifende Interaktionen
- Erkunden-Simulationen
Unterstützte Modelle und Standorte
Im Allgemeinen wird Priority PayGo für die Endpunkte global, us und eu unterstützt. Einige Modelle (z. B. Gemini 2.5-Modelle) unterstützen jedoch möglicherweise nicht alle drei Endpunkte. Auf den einzelnen Modellseiten, die über Google-Modelle verlinkt sind, können Sie nachsehen, welche Endpunkte bei der Verwendung von Priority PayGo unterstützt werden.
Die folgenden Modelle unterstützen Priority PayGo:
gemini-3.8-flash-cybergemini-3.8-flashgemini-3.7-flashgemini-3.6-flashgemini-3.5-flash-litegemini-3.5-flashgemini-3.1-flash-litegemini-3.1-pro-previewgemini-3-flash-previewgemini-2.5-progemini-2.5-flashgemini-2.5-flash-lite
Priority PayGo verwenden
Wenn Sie Anfragen mit Priority PayGo an die Gemini API senden möchten, müssen Sie den X-Vertex-AI-LLM-Shared-Request-Type-Header in Ihre Anfrage einfügen. Sie haben zwei Möglichkeiten, Priority PayGo zu nutzen:
Verwenden Sie das Kontingent für bereitgestellten Durchsatz (sofern verfügbar) und greifen Sie auf priorisiertes PayGo zurück.
Verwenden Sie nur Priority PayGo.
In den folgenden Beispielen wird der global-Endpunkt verwendet. Wenn Sie Ihre Anfragen stattdessen an einen Multi-Region-Endpunkt senden möchten, ersetzen Sie global durch us oder eu. Bei REST-Anfragen müssen Sie auch den Hostnamen aiplatform.googleapis.com durch aiplatform.us.rep.googleapis.com oder aiplatform.eu.rep.googleapis.com ersetzen. Weitere Informationen finden Sie unter Multi-Region-Endpunkte.
Priorisiertes PayGo verwenden, während Bereitgestellter Durchsatz als Standard festgelegt ist
Wenn Sie verfügbares Bereitgestellter Durchsatz-Kontingent nutzen möchten, bevor Sie Priority PayGo verwenden, fügen Sie den Header X-Vertex-AI-LLM-Shared-Request-Type: priority in Ihre Anfragen ein, wie in den folgenden Beispielen gezeigt.
Python
Installieren
pip install --upgrade google-genai
Weitere Informationen finden Sie in der SDK-Referenzdokumentation.
Umgebungsvariablen für die Verwendung des Google Gen AI SDK mit Vertex AI festlegen:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Initialisieren Sie Ihren GenAI-Client, um Priority PayGo zu verwenden. Nach diesem Schritt müssen Sie keine weiteren Anpassungen an Ihrem Code vornehmen, um über denselben Client mit der Gemini API zu interagieren und dabei Priority PayGo zu verwenden.
from google import genai from google.genai.types import HttpOptions client = genai.Client( vertexai=True, project='your_project_id', location='global', http_options=HttpOptions( api_version="v1", headers={ "X-Vertex-AI-LLM-Shared-Request-Type": "priority" }, ) )
REST
Nachdem Sie Ihre Umgebung eingerichtet haben, können Sie mit REST einen Text-Prompt testen. Im folgenden Beispiel wird eine Anfrage an den Publisher-Modellendpunkt gesendet.
Ersetzen Sie folgende Werte in den Anfragedaten:
PROJECT_ID: Ihre Projekt-ID. .MODEL_ID: Die Modell-ID des Modells, für das Sie Priority PayGo initialisieren möchten. Eine Liste der Modelle, die Priority PayGo unterstützen, finden Sie unter Modellversionen.PROMPT_TEXT: Die Textanleitung, die in den Prompt eingefügt werden soll. JSON.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
"https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
$'{
"contents": {
"role": "model",
"parts": { "text": "PROMPT_TEXT" }
}
}'
Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"text": "Response to sample request."
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 3,
"candidatesTokenCount": 900,
"totalTokenCount": 1957,
"trafficType": "ON_DEMAND_PRIORITY",
"thoughtsTokenCount": 1054
}
}
- Mit der Methode
generateContentkönnen Sie anfordern, dass die Antwort zurückgegeben wird, nachdem sie vollständig generiert wurde. Um die Wahrnehmung von Latenz für menschliche Zielgruppen zu verringern, streame die Antwort, während sie mithilfe der MethodestreamGenerateContenterzeugt wird. - Die multimodale Modell-ID befindet sich am Ende der URL vor der Methode (z. B.
gemini-3.5-flash). Dieses Beispiel unterstützt möglicherweise auch andere Modelle.
Nur Priority PayGo verwenden
Wenn Sie nur Priority PayGo verwenden möchten, fügen Sie Ihren Anfragen die Header X-Vertex-AI-LLM-Request-Type: shared und X-Vertex-AI-LLM-Shared-Request-Type: priority hinzu, wie in den folgenden Beispielen gezeigt.
Python
Installieren
pip install --upgrade google-genai
Weitere Informationen finden Sie in der SDK-Referenzdokumentation.
Umgebungsvariablen für die Verwendung des Google Gen AI SDK mit Vertex AI festlegen:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Initialisieren Sie Ihren GenAI-Client, um Priority PayGo zu verwenden. Nach diesem Schritt müssen Sie keine weiteren Anpassungen an Ihrem Code vornehmen, um über denselben Client mit der Gemini API zu interagieren und dabei Priority PayGo zu verwenden.
from google import genai from google.genai.types import HttpOptions client = genai.Client( vertexai=True, project='your_project_id', location='global', http_options=HttpOptions( api_version="v1", headers={ "X-Vertex-AI-LLM-Request-Type": "shared", "X-Vertex-AI-LLM-Shared-Request-Type": "priority" }, ) )
REST
Ersetzen Sie folgende Werte in den Anfragedaten:
PROJECT_ID: Ihre Projekt-ID. .MODEL_ID: Die Modell-ID des Modells, für das Sie Priority PayGo initialisieren möchten. Eine Liste der Modelle, die Priority PayGo unterstützen, finden Sie unter Modellversionen.PROMPT_TEXT: Die Textanleitung, die in den Prompt eingefügt werden soll. JSON.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-H "X-Vertex-AI-LLM-Request-Type: shared" \
-H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
"https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
$'{
"contents": {
"role": "model",
"parts": { "text": "PROMPT_TEXT" }
}
}'
Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"text": "Response to sample request."
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 3,
"candidatesTokenCount": 900,
"totalTokenCount": 1957,
"trafficType": "ON_DEMAND_PRIORITY",
"thoughtsTokenCount": 1054
}
}
- Mit der Methode
generateContentkönnen Sie anfordern, dass die Antwort zurückgegeben wird, nachdem sie vollständig generiert wurde. Um die Wahrnehmung von Latenz für menschliche Zielgruppen zu verringern, streame die Antwort, während sie mithilfe der MethodestreamGenerateContenterzeugt wird. - Die multimodale Modell-ID befindet sich am Ende der URL vor der Methode (z. B.
gemini-3.5-flash). Dieses Beispiel unterstützt möglicherweise auch andere Modelle.
Priority PayGo-Nutzung überprüfen
Sie können anhand des Traffictyps in der Antwort prüfen, ob für eine Anfrage Priority PayGo verwendet wurde. Hier sind einige Beispiele:
Python
Sie können anhand des Felds traffic_type in der Antwort prüfen, ob Priority PayGo für eine Anfrage verwendet wurde. Wenn Ihre Anfrage mit Priority PayGo verarbeitet wurde, ist das Feld traffic_type auf ON_DEMAND_PRIORITY festgelegt.
sdk_http_response=HttpResponse( headers=<dict len=9> ) candidates=[Candidate( avg_logprobs=-0.539712212302468, content=Content( parts=[ Part( text="""Response to sample request. """ ), ], role='model' ), finish_reason=<FinishReason.STOP: 'STOP'> )] create_time=datetime.datetime(2025, 12, 3, 20, 32, 55, 916498, tzinfo=TzInfo(0)) model_version='gemini-2.5-flash' prompt_feedback=None response_id='response_id' usage_metadata=GenerateContentResponseUsageMetadata( candidates_token_count=1408, candidates_tokens_details=[ ModalityTokenCount( modality=<MediaModality.TEXT: 'TEXT'>, token_count=1408 ), ], prompt_token_count=5, prompt_tokens_details=[ ModalityTokenCount( modality=<MediaModality.TEXT: 'TEXT'>, token_count=5 ), ], thoughts_token_count=1356, total_token_count=2769, traffic_type=<TrafficType.ON_DEMAND_PRIORITY: 'ON_DEMAND_PRIORITY'> ) automatic_function_calling_history=[] parsed=None
REST
Sie können anhand des Felds trafficType in der Antwort prüfen, ob Priority PayGo für eine Anfrage verwendet wurde. Wenn Ihre Anfrage mit Priority PayGo verarbeitet wurde, ist das Feld trafficType auf ON_DEMAND_PRIORITY festgelegt.
{ "candidates": [ { "content": { "role": "model", "parts": [ { "text": "Response to sample request." } ] }, "finishReason": "STOP" } ], "usageMetadata": { "promptTokenCount": 3, "candidatesTokenCount": 900, "totalTokenCount": 1957, "trafficType": "ON_DEMAND_PRIORITY", "thoughtsTokenCount": 1054 } }
Durchsatzlimits
Priority PayGo bietet ein grundlegendes Durchsatzlimit auf Organisationsebene für jedes Modell:
- Gemini Pro-Modelle: 10.000.000 Tokens pro Minute
- Gemini Flash- und Flash-Lite-Modelle: 50.000.000 Tokens pro Minute
Diese Limits sind für Ihre Organisation sofort verfügbar. Es gibt keine Anlaufphase und Sie müssen nicht erst eine nachhaltige Nutzung aufbauen, bevor Sie sie erreichen können. Ähnlich wie bei Standard PayGo gilt das für eine Modellfamilie angegebene Durchsatzlimit unabhängig für jedes Modell innerhalb dieser Familie.
Traffic, der über Ihrem Limit liegt, wird nicht automatisch herabgestuft. Wenn Kapazität verfügbar ist, wird dieser Traffic weiterhin mit Priorität über die Agent Platform bereitgestellt und zu Priority PayGo-Tarifen abgerechnet. Anfragen werden nur dann auf Standard-PayGo herabgestuft, wenn keine zusätzliche Kapazität vorhanden ist, um sie mit Priorität zu verarbeiten. Diese Anfragen werden zu Standard-PayGo-Preisen abgerechnet.
Sie können anhand der Antwort prüfen, ob eine Anfrage herabgestuft wurde. Bei Anfragen, die auf Standard PayGo herabgestuft werden, wird der Traffictyp auf ON_DEMAND festgelegt. Weitere Informationen finden Sie unter Priority PayGo-Nutzung prüfen.
Um die Wahrscheinlichkeit eines Downgrades zu verringern, sollten Sie den Traffic über jede Minute hinweg gleichmäßig verteilen, anstatt scharfe Spitzen auf Sekundenebene zu senden. Wenn für Ihre Arbeitslast ein höheres Limit erforderlich ist, wenden Sie sich an Ihr Vertriebsteam. Informationen zu Arbeitslasten, die eine dedizierte, garantierte Kapazität erfordern, finden Sie unter Bereitgestellter Durchsatz.
Nächste Schritte
- Weitere Informationen zum bereitgestellten Durchsatz finden Sie unter Bereitgestellter Durchsatz.
- Informationen zu Kontingenten und Limits für die Agent Platform finden Sie unter Kontingente und Limits für die Gemini Enterprise Agent Platform.
- Weitere Informationen zu Google Cloud Kontingenten und Systemlimits finden Sie in der Dokumentation zu Cloud-Kontingenten.