xAI Grok-Modelle

xAI Grok-Modelle sind als verwaltete APIs auf der Gemini Enterprise Agent Platform verfügbar. Sie können Ihre Antworten streamen, um die vom Endnutzer wahrgenommene Latenz zu reduzieren. Eine gestreamte Antwort verwendet Server-Sent Events (SSE), um die Antwort schrittweise zu streamen.

Verwaltete xAI-Modelle

Die folgenden Modelle sind von xAI zur Verwendung in der Gemini Enterprise Agent Platform verfügbar. Rufen Sie die zugehörige Model Garden-Modellkarte auf, um auf ein xAI-Modell zuzugreifen.

Grok 4.7 Ein leistungsstarkes Modell von xAI, das für Programmieren und Wissensarbeit entwickelt wurde. Es arbeitet länger an schwierigen Aufgaben und überprüft seine eigene Arbeit.
Grok 4.6 Ein leistungsstarkes Modell von xAI, das für Programmierung, Agentenaufgaben und Wissensarbeit entwickelt wurde.
Grok 4.3 Ein leistungsstarkes Modell von xAI.
Grok 4.20 (Reasoning) Ein leistungsstarkes Modell von xAI mit einer niedrigen Halluzinationsrate. Hervorragend geeignet für Aufgaben zum Dokumentverständnis und für den Aufruf von Agent-Tools über einen langen Zeitraum.
Grok 4.20 (Non-reasoning) Ein leistungsstarkes Modell von xAI ohne Reasoning-Funktion, das sich durch eine niedrige Halluzinationsrate auszeichnet. Hervorragend geeignet für latenzempfindliche Anwendungsfälle wie Kundensupport und Kategorisierung.
Grok 4.1 Fast (Reasoning) (Eingestellt) Ein kostengünstiges Modell von xAI mit leistungsstarken Funktionen zum Aufrufen von Tools und effizienter Synthese von Wissensdatenbanken. Er ist hervorragend für Suchaufgaben geeignet, die Webdaten und interne Wissensdatenbank-Tools umfassen.
Grok 4.1 Fast (Non-reasoning) (Eingestellt) Ein kosteneffizientes Modell von xAI ohne Thinking-Funktion, optimiert für niedrige Latenz. Das Modell eignet sich hervorragend für Aufgaben mit hohem Volumen wie Zusammenfassung und Kategorisierung.

xAI-Modelle verwenden

Informationen zum Ausführen von Streaming- und Nicht-Streaming-Aufrufen für xAI-Modelle finden Sie unter Open-Model-APIs aufrufen.

Bei verwalteten Modellen können Sie curl-Befehle verwenden, um Anfragen mit den folgenden Modellnamen an den Gemini Enterprise Agent Platform-Endpunkt zu senden:

  • Verwenden Sie für Grok 4.7 grok-4.7.
  • Verwenden Sie für Grok 4.6 grok-4.6.
  • Für Grok 4.3 verwenden Sie grok-4.3.
  • Verwenden Sie für Grok 4.20 (Reasoning) grok-4.20-reasoning.
  • Verwenden Sie für Grok 4.20 (Non-reasoning) grok-4.20-non-reasoning.
  • Für Grok 4.1 Fast (Reasoning) verwenden Sie grok-4.1-fast-reasoning.
  • Für Grok 4.1 Fast (ohne Schlussfolgerungen) verwenden Sie grok-4.1-fast-non-reasoning.

Grok-Kontingente

Für Grok-Modelle gilt ein einzelnes globales Kontingent pro Basismodell und nicht pro Endpunkt. Anfragen an den globalen Endpunkt und den multiregionalen Endpunkt für die USA werden auf dasselbe zugrunde liegende Limit angerechnet. Das Kontingent wird in Abfragen pro Minute (Queries per minute, QPM) und Tokens pro Minute (Tokens per minute, TPM) angegeben. TPM umfasst sowohl Eingabe- als auch Ausgabetokens.

Um die allgemeine Dienstleistung und die zulässige Nutzung aufrechtzuerhalten, können die maximalen Kontingente je nach Konto variieren. In einigen Fällen kann der Zugriff eingeschränkt werden. Die Kontingente Ihres Projekts finden Sie in der Google Cloud Console auf der Seite Kontingente und Systemlimits. Außerdem müssen die folgenden Kontingente verfügbar sein:

  • global_generate_content_requests_per_minute_per_project_per_base_model definiert Ihr QPM-Kontingent.

  • Für TPM gibt es zwei Kontingentwerte, die für bestimmte Modelle gelten: global_generate_content_input_tokens_per_minute_per_base_model definiert das TPM-Kontingent für die Eingabe und global_generate_content_output_tokens_per_minute_per_base_model das TPM-Kontingent für die Ausgabe.

Auf den jeweiligen Modellseiten finden Sie Informationen dazu, bei welchen Modellen Eingabe- und Ausgabetokens separat gezählt werden.

Nächste Schritte