Priority PayGo

Priorisiertes „Pay as you go“ (priorisiertes PayGo) ist eine Nutzungsoption, die eine konsistentere Leistung als Standard-PayGo bietet, ohne dass eine Vorabzusicherung für bereitgestellten Durchsatz erforderlich ist.

Bei der Verwendung von priorisiertem PayGo wird die Nutzung von Tokens zu einem höheren Preis als bei Standard-PayGo in Rechnung gestellt. Informationen zu den Preisen finden Sie auf der Preisseite für die Gemini Enterprise Agent Platform.

Wann sollte Priority PayGo verwendet werden?

Priority PayGo ist ideal für geschäftskritische Arbeitslasten mit schwankenden oder unvorhersehbaren Traffic-Mustern. Beispiele:

  • Virtuelle Assistenten für Kunden
  • Agentische Workflows und agentenübergreifende Interaktionen
  • Erkunden-Simulationen

Unterstützte Modelle und Standorte

Im Allgemeinen wird Priority PayGo für die Endpunkte global, us und eu unterstützt. Einige Modelle (z. B. Gemini 2.5-Modelle) unterstützen jedoch möglicherweise nicht alle drei Endpunkte. Auf den einzelnen Modellseiten, die über Google-Modelle verlinkt sind, können Sie nachsehen, welche Endpunkte bei der Verwendung von Priority PayGo unterstützt werden.

Die folgenden Modelle unterstützen Priority PayGo:

Priority PayGo verwenden

Wenn Sie Anfragen mit Priority PayGo an die Gemini API senden möchten, müssen Sie den X-Vertex-AI-LLM-Shared-Request-Type-Header in Ihre Anfrage einfügen. Sie haben zwei Möglichkeiten, Priority PayGo zu nutzen:

  • Verwenden Sie das Kontingent für bereitgestellten Durchsatz (sofern verfügbar) und greifen Sie auf priorisiertes PayGo zurück.

  • Verwenden Sie nur Priority PayGo.

In den folgenden Beispielen wird der global-Endpunkt verwendet. Wenn Sie Ihre Anfragen stattdessen an einen Multi-Region-Endpunkt senden möchten, ersetzen Sie global durch us oder eu. Bei REST-Anfragen müssen Sie auch den Hostnamen aiplatform.googleapis.com durch aiplatform.us.rep.googleapis.com oder aiplatform.eu.rep.googleapis.com ersetzen. Weitere Informationen finden Sie unter Multi-Region-Endpunkte.

Priorisiertes PayGo verwenden, während Bereitgestellter Durchsatz als Standard festgelegt ist

Wenn Sie verfügbares Bereitgestellter Durchsatz-Kontingent nutzen möchten, bevor Sie Priority PayGo verwenden, fügen Sie den Header X-Vertex-AI-LLM-Shared-Request-Type: priority in Ihre Anfragen ein, wie in den folgenden Beispielen gezeigt.

Python

Installieren

pip install --upgrade google-genai

Weitere Informationen finden Sie in der SDK-Referenzdokumentation.

Umgebungsvariablen für die Verwendung des Google Gen AI SDK mit Vertex AI festlegen:

# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values
# with appropriate values for your project.
export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT
export GOOGLE_CLOUD_LOCATION=global
export GOOGLE_GENAI_USE_ENTERPRISE=True

Initialisieren Sie Ihren GenAI-Client, um Priority PayGo zu verwenden. Nach diesem Schritt müssen Sie keine weiteren Anpassungen an Ihrem Code vornehmen, um über denselben Client mit der Gemini API zu interagieren und dabei Priority PayGo zu verwenden.

from google import genai
from google.genai.types import HttpOptions
client = genai.Client(
  vertexai=True, project='your_project_id', location='global',
  http_options=HttpOptions(
    api_version="v1",
      headers={
        "X-Vertex-AI-LLM-Shared-Request-Type": "priority"
      },
  )
)

REST

Nachdem Sie Ihre Umgebung eingerichtet haben, können Sie mit REST einen Text-Prompt testen. Im folgenden Beispiel wird eine Anfrage an den Publisher-Modellendpunkt gesendet.

Ersetzen Sie folgende Werte in den Anfragedaten:

  • PROJECT_ID: Ihre Projekt-ID. .
  • MODEL_ID: Die Modell-ID des Modells, für das Sie Priority PayGo initialisieren möchten. Eine Liste der Modelle, die Priority PayGo unterstützen, finden Sie unter Modellversionen.
  • PROMPT_TEXT: Die Textanleitung, die in den Prompt eingefügt werden soll. JSON.
curl -X POST \
  -H "Authorization: Bearer $(gcloud auth print-access-token)" \
  -H "Content-Type: application/json; charset=utf-8" \
  -H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
  "https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
  $'{
      "contents": {
        "role": "model",
        "parts": { "text": "PROMPT_TEXT" }
    }
  }'

Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:

{
  "candidates": [
    {
      "content": {
        "role": "model",
        "parts": [
          {
            "text": "Response to sample request."
          }
        ]
      },
      "finishReason": "STOP"
    }
  ],
  "usageMetadata": {
    "promptTokenCount": 3,
    "candidatesTokenCount": 900,
    "totalTokenCount": 1957,
    "trafficType": "ON_DEMAND_PRIORITY",
    "thoughtsTokenCount": 1054
  }
}
  • Mit der Methode generateContent können Sie anfordern, dass die Antwort zurückgegeben wird, nachdem sie vollständig generiert wurde. Um die Wahrnehmung von Latenz für menschliche Zielgruppen zu verringern, streame die Antwort, während sie mithilfe der Methode streamGenerateContent erzeugt wird.
  • Die multimodale Modell-ID befindet sich am Ende der URL vor der Methode (z. B. gemini-3.5-flash). Dieses Beispiel unterstützt möglicherweise auch andere Modelle.

Nur Priority PayGo verwenden

Wenn Sie nur Priority PayGo verwenden möchten, fügen Sie Ihren Anfragen die Header X-Vertex-AI-LLM-Request-Type: shared und X-Vertex-AI-LLM-Shared-Request-Type: priority hinzu, wie in den folgenden Beispielen gezeigt.

Python

Installieren

pip install --upgrade google-genai

Weitere Informationen finden Sie in der SDK-Referenzdokumentation.

Umgebungsvariablen für die Verwendung des Google Gen AI SDK mit Vertex AI festlegen:

# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values
# with appropriate values for your project.
export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT
export GOOGLE_CLOUD_LOCATION=global
export GOOGLE_GENAI_USE_ENTERPRISE=True

Initialisieren Sie Ihren GenAI-Client, um Priority PayGo zu verwenden. Nach diesem Schritt müssen Sie keine weiteren Anpassungen an Ihrem Code vornehmen, um über denselben Client mit der Gemini API zu interagieren und dabei Priority PayGo zu verwenden.

from google import genai
from google.genai.types import HttpOptions
client = genai.Client(
  vertexai=True, project='your_project_id', location='global',
  http_options=HttpOptions(
    api_version="v1",
      headers={
        "X-Vertex-AI-LLM-Request-Type": "shared",
        "X-Vertex-AI-LLM-Shared-Request-Type": "priority"
      },
  )
)

REST

Ersetzen Sie folgende Werte in den Anfragedaten:

  • PROJECT_ID: Ihre Projekt-ID. .
  • MODEL_ID: Die Modell-ID des Modells, für das Sie Priority PayGo initialisieren möchten. Eine Liste der Modelle, die Priority PayGo unterstützen, finden Sie unter Modellversionen.
  • PROMPT_TEXT: Die Textanleitung, die in den Prompt eingefügt werden soll. JSON.
curl -X POST \
  -H "Authorization: Bearer $(gcloud auth print-access-token)" \
  -H "Content-Type: application/json; charset=utf-8" \
  -H "X-Vertex-AI-LLM-Request-Type: shared" \
  -H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
  "https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
  $'{
      "contents": {
        "role": "model",
        "parts": { "text": "PROMPT_TEXT" }
    }
  }'

Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:

{
  "candidates": [
    {
      "content": {
        "role": "model",
        "parts": [
          {
            "text": "Response to sample request."
          }
        ]
      },
      "finishReason": "STOP"
    }
  ],
  "usageMetadata": {
    "promptTokenCount": 3,
    "candidatesTokenCount": 900,
    "totalTokenCount": 1957,
    "trafficType": "ON_DEMAND_PRIORITY",
    "thoughtsTokenCount": 1054
  }
}
  • Mit der Methode generateContent können Sie anfordern, dass die Antwort zurückgegeben wird, nachdem sie vollständig generiert wurde. Um die Wahrnehmung von Latenz für menschliche Zielgruppen zu verringern, streame die Antwort, während sie mithilfe der Methode streamGenerateContent erzeugt wird.
  • Die multimodale Modell-ID befindet sich am Ende der URL vor der Methode (z. B. gemini-3.5-flash). Dieses Beispiel unterstützt möglicherweise auch andere Modelle.

Priority PayGo-Nutzung überprüfen

Sie können anhand des Traffictyps in der Antwort prüfen, ob für eine Anfrage Priority PayGo verwendet wurde. Hier sind einige Beispiele:

Python

Sie können anhand des Felds traffic_type in der Antwort prüfen, ob Priority PayGo für eine Anfrage verwendet wurde. Wenn Ihre Anfrage mit Priority PayGo verarbeitet wurde, ist das Feld traffic_type auf ON_DEMAND_PRIORITY festgelegt.

sdk_http_response=HttpResponse(
  headers=<dict len=9>
) candidates=[Candidate(
  avg_logprobs=-0.539712212302468,
  content=Content(
    parts=[
      Part(
        text="""Response to sample request.
        """
      ),
    ],
    role='model'
  ),
  finish_reason=<FinishReason.STOP: 'STOP'>
)] create_time=datetime.datetime(2025, 12, 3, 20, 32, 55, 916498, tzinfo=TzInfo(0)) model_version='gemini-2.5-flash' prompt_feedback=None response_id='response_id' usage_metadata=GenerateContentResponseUsageMetadata(
  candidates_token_count=1408,
  candidates_tokens_details=[
    ModalityTokenCount(
      modality=<MediaModality.TEXT: 'TEXT'>,
      token_count=1408
    ),
  ],
  prompt_token_count=5,
  prompt_tokens_details=[
    ModalityTokenCount(
      modality=<MediaModality.TEXT: 'TEXT'>,
      token_count=5
    ),
  ],
  thoughts_token_count=1356,
  total_token_count=2769,
  traffic_type=<TrafficType.ON_DEMAND_PRIORITY: 'ON_DEMAND_PRIORITY'>
) automatic_function_calling_history=[] parsed=None

REST

Sie können anhand des Felds trafficType in der Antwort prüfen, ob Priority PayGo für eine Anfrage verwendet wurde. Wenn Ihre Anfrage mit Priority PayGo verarbeitet wurde, ist das Feld trafficType auf ON_DEMAND_PRIORITY festgelegt.

{
  "candidates": [
    {
      "content": {
        "role": "model",
        "parts": [
          {
            "text": "Response to sample request."
          }
        ]
      },
      "finishReason": "STOP"
    }
  ],
  "usageMetadata": {
    "promptTokenCount": 3,
    "candidatesTokenCount": 900,
    "totalTokenCount": 1957,
    "trafficType": "ON_DEMAND_PRIORITY",
    "thoughtsTokenCount": 1054
  }
}

Durchsatzlimits

Priority PayGo bietet ein grundlegendes Durchsatzlimit auf Organisationsebene für jedes Modell:

  • Gemini Pro-Modelle: 10.000.000 Tokens pro Minute
  • Gemini Flash- und Flash-Lite-Modelle: 50.000.000 Tokens pro Minute

Diese Limits sind für Ihre Organisation sofort verfügbar. Es gibt keine Anlaufphase und Sie müssen nicht erst eine nachhaltige Nutzung aufbauen, bevor Sie sie erreichen können. Ähnlich wie bei Standard PayGo gilt das für eine Modellfamilie angegebene Durchsatzlimit unabhängig für jedes Modell innerhalb dieser Familie.

Traffic, der über Ihrem Limit liegt, wird nicht automatisch herabgestuft. Wenn Kapazität verfügbar ist, wird dieser Traffic weiterhin mit Priorität über die Agent Platform bereitgestellt und zu Priority PayGo-Tarifen abgerechnet. Anfragen werden nur dann auf Standard-PayGo herabgestuft, wenn keine zusätzliche Kapazität vorhanden ist, um sie mit Priorität zu verarbeiten. Diese Anfragen werden zu Standard-PayGo-Preisen abgerechnet.

Sie können anhand der Antwort prüfen, ob eine Anfrage herabgestuft wurde. Bei Anfragen, die auf Standard PayGo herabgestuft werden, wird der Traffictyp auf ON_DEMAND festgelegt. Weitere Informationen finden Sie unter Priority PayGo-Nutzung prüfen.

Um die Wahrscheinlichkeit eines Downgrades zu verringern, sollten Sie den Traffic über jede Minute hinweg gleichmäßig verteilen, anstatt scharfe Spitzen auf Sekundenebene zu senden. Wenn für Ihre Arbeitslast ein höheres Limit erforderlich ist, wenden Sie sich an Ihr Vertriebsteam. Informationen zu Arbeitslasten, die eine dedizierte, garantierte Kapazität erfordern, finden Sie unter Bereitgestellter Durchsatz.

Nächste Schritte