„Priority Pay-as-you-go“ (Priority PayGo) ist eine Verbrauchsoption, die eine konsistentere Leistung als „Standard Pay-as-you-go“ bietet, ohne dass eine Vorabverpflichtung für bereitgestellten Durchsatz erforderlich ist.
Bei der Verwendung von Priority PayGo werden Ihnen die Token zu einem höheren Preis als bei „Standard Pay-as-you-go“ in Rechnung gestellt. Informationen zu den Preisen finden Sie auf der Preisseite der Gemini Enterprise Agent Platform.
Wann sollte Priority PayGo verwendet werden?
Priority PayGo ist ideal für geschäftskritische Arbeitslasten mit schwankenden oder unvorhersehbaren Traffic-Mustern. Beispielanwendungsfälle:
- Virtuelle Assistenten für Kunden
- Agentische Workflows und agentenübergreifende Interaktionen
- Erkunden-Simulationen
Unterstützte Modelle und Standorte
Die folgenden Modelle unterstützen Priority PayGo nur im global-Endpunkt. Priority PayGo unterstützt keine regionalen oder multiregionalen Endpunkte.
gemini-3.8-flashgemini-3.7-flashgemini-3.6-flashgemini-3.5-flash-litegemini-3.5-flashgemini-3.1-flash-litegemini-3.1-pro-previewgemini-3-flash-previewgemini-2.5-progemini-2.5-flashgemini-2.5-flash-lite
Priority PayGo verwenden
Wenn Sie Anfragen mit Priority PayGo an die Gemini API senden möchten, müssen Sie den Header X-Vertex-AI-LLM-Shared-Request-Type in Ihre Anfrage einfügen. Sie können Priority PayGo auf zwei Arten verwenden:
Kontingent für bereitgestellten Durchsatz verwenden (falls verfügbar) und auf Priority PayGo ausweichen.
Nur Priority PayGo verwenden.
Priority PayGo verwenden, während bereitgestellter Durchsatz als Standard verwendet wird
Wenn Sie das verfügbare Kontingent für bereitgestellten Durchsatz nutzen möchten, bevor Sie Priority PayGo verwenden, fügen Sie den Header X-Vertex-AI-LLM-Shared-Request-Type: priority in Ihre Anfragen ein, wie in den folgenden Beispielen gezeigt.
Python
Installieren
pip install --upgrade google-genai
Weitere Informationen finden Sie in der SDK-Referenzdokumentation.
Legen Sie Umgebungsvariablen fest, um das Google Gen AI SDK mit Vertex AI zu verwenden:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Initialisieren Sie Ihren GenAI-Client, um Priority PayGo zu verwenden. Nach diesem Schritt müssen Sie keine weiteren Anpassungen an Ihrem Code vornehmen, um mit demselben Client mit Priority PayGo mit der Gemini API zu interagieren.
from google import genai from google.genai.types import HttpOptions client = genai.Client( vertexai=True, project='your_project_id', location='global', http_options=HttpOptions( api_version="v1", headers={ "X-Vertex-AI-LLM-Shared-Request-Type": "priority" }, ) )
REST
Nachdem Sie Ihre Umgebung eingerichtet haben, können Sie mit REST einen Text-Prompt testen. Im folgenden Beispiel wird eine Anfrage an den Publisher-Modellendpunkt gesendet.
Ersetzen Sie diese Werte in den folgenden Anfragedaten:
PROJECT_ID: Ihre Projekt-ID. .MODEL_ID: Die Modell-ID des Modells für das Sie Priority PayGo initialisieren möchten. Eine Liste der Modelle, die Priority PayGo unterstützen, finden Sie unter Modellversionen.PROMPT_TEXT: Die Textanleitung, die in den Prompt eingefügt werden soll. JSON.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
"https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
$'{
"contents": {
"role": "model",
"parts": { "text": "PROMPT_TEXT" }
}
}'
Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"text": "Response to sample request."
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 3,
"candidatesTokenCount": 900,
"totalTokenCount": 1957,
"trafficType": "ON_DEMAND_PRIORITY",
"thoughtsTokenCount": 1054
}
}
- Mit der
generateContentMethode können Sie anfordern, dass die Antwort zurückgegeben wird, nachdem sie vollständig generiert wurde. Um die Wahrnehmung von Latenz für menschliche Zielgruppen zu verringern, streamen Sie die Antwort, während sie mithilfe derstreamGenerateContentMethode erzeugt wird. - Die multimodale Modell-ID befindet sich am Ende der URL vor der Methode
(z. B.
gemini-3.5-flash). Dieses Beispiel unterstützt möglicherweise auch andere Modelle.
Nur Priority PayGo verwenden
Wenn Sie nur Priority PayGo verwenden möchten, fügen Sie die Header X-Vertex-AI-LLM-Request-Type: shared und X-Vertex-AI-LLM-Shared-Request-Type: priority in Ihre Anfragen ein, wie in den folgenden Beispielen gezeigt.
Python
Installieren
pip install --upgrade google-genai
Weitere Informationen finden Sie in der SDK-Referenzdokumentation.
Legen Sie Umgebungsvariablen fest, um das Google Gen AI SDK mit Vertex AI zu verwenden:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Initialisieren Sie Ihren GenAI-Client, um Priority PayGo zu verwenden. Nach diesem Schritt müssen Sie keine weiteren Anpassungen an Ihrem Code vornehmen, um mit demselben Client mit Priority PayGo mit der Gemini API zu interagieren.
from google import genai from google.genai.types import HttpOptions client = genai.Client( vertexai=True, project='your_project_id', location='global', http_options=HttpOptions( api_version="v1", headers={ "X-Vertex-AI-LLM-Request-Type": "shared", "X-Vertex-AI-LLM-Shared-Request-Type": "priority" }, ) )
REST
Ersetzen Sie diese Werte in den folgenden Anfragedaten:
PROJECT_ID: Ihre Projekt-ID. .MODEL_ID: Die Modell-ID des Modells für das Sie Priority PayGo initialisieren möchten. Eine Liste der Modelle, die Priority PayGo unterstützen, finden Sie unter Modellversionen.PROMPT_TEXT: Die Textanleitung, die in den Prompt eingefügt werden soll. JSON.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-H "X-Vertex-AI-LLM-Request-Type: shared" \
-H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
"https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
$'{
"contents": {
"role": "model",
"parts": { "text": "PROMPT_TEXT" }
}
}'
Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"text": "Response to sample request."
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 3,
"candidatesTokenCount": 900,
"totalTokenCount": 1957,
"trafficType": "ON_DEMAND_PRIORITY",
"thoughtsTokenCount": 1054
}
}
- Mit der
generateContentMethode können Sie anfordern, dass die Antwort zurückgegeben wird, nachdem sie vollständig generiert wurde. Um die Wahrnehmung von Latenz für menschliche Zielgruppen zu verringern, streamen Sie die Antwort, während sie mithilfe derstreamGenerateContentMethode erzeugt wird. - Die multimodale Modell-ID befindet sich am Ende der URL vor der Methode
(z. B.
gemini-3.5-flash). Dieses Beispiel unterstützt möglicherweise auch andere Modelle.
Priority PayGo-Nutzung prüfen
Sie können anhand des Traffictyps in der Antwort prüfen, ob eine Anfrage Priority PayGo verwendet hat, wie in den folgenden Beispielen gezeigt.
Python
Sie können anhand des Felds traffic_type in der Antwort prüfen, ob Priority PayGo für eine Anfrage verwendet wurde. Wenn Ihre Anfrage mit Priority PayGo verarbeitet wurde, ist das Feld traffic_type auf ON_DEMAND_PRIORITY festgelegt.
sdk_http_response=HttpResponse( headers=<dict len=9> ) candidates=[Candidate( avg_logprobs=-0.539712212302468, content=Content( parts=[ Part( text="""Response to sample request. """ ), ], role='model' ), finish_reason=<FinishReason.STOP: 'STOP'> )] create_time=datetime.datetime(2025, 12, 3, 20, 32, 55, 916498, tzinfo=TzInfo(0)) model_version='gemini-2.5-flash' prompt_feedback=None response_id='response_id' usage_metadata=GenerateContentResponseUsageMetadata( candidates_token_count=1408, candidates_tokens_details=[ ModalityTokenCount( modality=<MediaModality.TEXT: 'TEXT'>, token_count=1408 ), ], prompt_token_count=5, prompt_tokens_details=[ ModalityTokenCount( modality=<MediaModality.TEXT: 'TEXT'>, token_count=5 ), ], thoughts_token_count=1356, total_token_count=2769, traffic_type=<TrafficType.ON_DEMAND_PRIORITY: 'ON_DEMAND_PRIORITY'> ) automatic_function_calling_history=[] parsed=None
REST
Sie können anhand des Felds trafficType in der Antwort prüfen, ob Priority PayGo für eine Anfrage verwendet wurde. Wenn Ihre Anfrage mit Priority PayGo verarbeitet wurde, ist das Feld trafficType auf ON_DEMAND_PRIORITY festgelegt.
{ "candidates": [ { "content": { "role": "model", "parts": [ { "text": "Response to sample request." } ] }, "finishReason": "STOP" } ], "usageMetadata": { "promptTokenCount": 3, "candidatesTokenCount": 900, "totalTokenCount": 1957, "trafficType": "ON_DEMAND_PRIORITY", "thoughtsTokenCount": 1054 } }
Durchsatzlimits
Priority PayGo bietet ein grundlegendes Durchsatzlimit auf Organisationsebene für jedes Modell:
- Gemini Pro-Modelle: 10.000.000 Token pro Minute
- Gemini Flash- und Flash-Lite-Modelle: 50.000.000 Token pro Minute
Diese Limits sind für Ihre Organisation sofort verfügbar. Es gibt keine Einführungsphase und Sie müssen keine nachhaltige Nutzung aufbauen, bevor Sie sie erreichen können. Ähnlich wie bei „Standard Pay-as-you-go“, gilt das für eine Modellfamilie angegebene Durchsatzlimit unabhängig für jedes Modell innerhalb dieser Familie.
Traffic über Ihrem Limit wird nicht automatisch herabgestuft. Wenn Kapazität verfügbar ist, verarbeitet die Agent Platform diesen Traffic weiterhin mit Priorität und er wird zu Priority PayGo-Preisen in Rechnung gestellt. Anfragen werden nur dann auf „Standard Pay-as-you-go“ herabgestuft, wenn keine freie Kapazität vorhanden ist, um sie mit Priorität zu verarbeiten. Diese Anfragen werden zu „Standard Pay-as-you-go“-Preisen in Rechnung gestellt.
Sie können in der Antwort prüfen, ob eine Anfrage herabgestuft wurde. Bei Anfragen, die auf „Standard Pay-as-you-go“ herabgestuft wurden, ist der Traffictyp auf ON_DEMAND festgelegt. Weitere Informationen finden Sie unter
Priority PayGo-Nutzung prüfen.
Um die Wahrscheinlichkeit einer Herabstufung zu verringern, sollten Sie den Traffic pro Minute gleichmäßig verteilen, anstatt scharfe Spitzen auf Sekundenebene zu senden. Wenn für Ihre Arbeitslast ein höheres Limit erforderlich ist, wenden Sie sich an Ihr Vertriebsteam. Informationen zu Arbeitslasten, die eine dedizierte, garantierte Kapazität benötigen, finden Sie unter Bereitgestellter Durchsatz.
Nächste Schritte
- Weitere Informationen zu bereitgestelltem Durchsatz finden Sie unter Bereitgestellter Durchsatz.
- Informationen zu Kontingenten und Limits für die Agent Platform finden Sie unter Kontingente und Limits der Gemini Enterprise Agent Platform.
- Weitere Informationen zu Google Cloud Kontingenten und Systemlimits finden Sie in der Dokumentation zu Cloud-Kontingenten.