xAI Grok-Modelle können als verwaltete APIs in der Gemini Enterprise Agent Platform verwendet werden. Sie können Ihre Antworten streamen, um die vom Endnutzer wahrgenommene Latenz zu reduzieren. Eine gestreamte Antwort verwendet vom Server gesendete Ereignisse (SSE, Server-Sent Events), um die Antwort schrittweise zu streamen.
Verwaltete xAI-Modelle
Die folgenden Modelle sind von xAI zur Verwendung in der Gemini Enterprise Agent Platform verfügbar. Rufen Sie die zugehörige Model Garden-Modellkarte auf, um auf ein xAI-Modell zuzugreifen.
Grok 4.3
Grok 4.3 ist das Flagship-Modell von xAI.
Grok 4.20 (Reasoning)
Grok 4.20 (Reasoning) ist das Flagship-Modell von xAI, das sich durch eine branchenweit führende, niedrige Halluzinationsrate auszeichnet. Es eignet sich hervorragend für Aufgaben zum Verständnis von Dokumenten und für das agentische Aufrufen von Tools über einen langen Zeitraum.
Zur Modellkarte von Grok 4.20 (Reasoning)
Grok 4.20 (Non-reasoning)
Grok 4.20 (Non-reasoning) ist das Flagship-Modell von xAI ohne Thinking-Funktion, das sich durch eine branchenweit führende, niedrige Halluzinationsrate auszeichnet. Es eignet sich hervorragend für latenzempfindliche Anwendungsfälle wie Kundensupport und Kategorisierung.
Zur Modellkarte von Grok 4.20 (Non-reasoning)
Grok 4.1 Fast (Reasoning)
Grok 4.1 Fast (Reasoning) ist das kostengünstigste Modell von xAI mit leistungsstarken Funktionen zum Aufrufen von Tools und effizienter Synthese von Wissensdatenbanken. Es eignet sich hervorragend für Suchaufgaben mit Webdaten und Tools für interne Wissensdatenbanken.
Zur Modellkarte von Grok 4.1 Fast (Reasoning)
Grok 4.1 Fast (Non-reasoning)
Grok 4.1 Fast (Non-reasoning) ist das kosteneffizienteste Modell von xAI ohne Thinking-Funktion, optimiert für niedrige Latenz. Es eignet sich hervorragend für Aufgaben mit hohem Datenvolumen wie Zusammenfassung und Kategorisierung.
Zur Modellkarte von Grok 4.1 Fast (Non-reasoning)
xAI-Modelle verwenden
Für verwaltete Modelle können Sie curl-Befehle verwenden, um Anfragen mit den folgenden Modellnamen an den Endpunkt der Gemini Enterprise Agent Platform zu senden. Informationen zum Ausführen von Streaming- und Nicht-Streaming-Aufrufen an xAI Modelle finden Sie unter APIs für offene Modelle aufrufen.
Für verwaltete Modelle können Sie curl-Befehle verwenden, um Anfragen mit den folgenden Modellnamen an den Endpunkt der Gemini Enterprise Agent Platform zu senden:
- Verwenden Sie für Grok 4.3
grok-4.3. - Verwenden Sie für Grok 4.20 (Reasoning)
grok-4.20-reasoning. - Verwenden Sie für Grok 4.20 (Non-reasoning)
grok-4.20-non-reasoning. - Verwenden Sie für Grok 4.1 Fast (Reasoning)
grok-4.1-fast-reasoning. - Verwenden Sie für Grok 4.1 Fast (Non-reasoning)
grok-4.1-fast-non-reasoning.
Grok-Kontingente
Für Grok-Modelle gilt ein globales Kontingent. Das Kontingent wird in Abfragen pro Minute (Queries per minute, QPM) und Tokens pro Minute (Tokens per minute, TPM) angegeben. TPM umfasst sowohl Eingabe- als auch Ausgabetokens.
Um die allgemeine Dienstleistung zu gewährleisten und eine akzeptable Nutzung zu ermöglichen, können die maximalen Kontingente je nach Konto variieren. In einigen Fällen kann der Zugriff eingeschränkt sein. Die Kontingente Ihres Projekts finden Sie in der Google Cloud Console auf der Seite „Kontingente und System limits“. Außerdem müssen die folgenden Kontingente verfügbar sein:
global_generate_content_requests_per_minute_per_project_per_base_modeldefiniert Ihr QPM-Kontingent.Für TPM gibt es zwei Kontingentwerte, die für bestimmte Modelle gelten:
global_generate_content_input_tokens_per_minute_per_base_modeldefiniert das Eingabe-TPM-Kontingent undglobal_generate_content_output_tokens_per_minute_per_base_modeldefiniert das Ausgabe-TPM-Kontingent.
Auf den Seiten der einzelnen Modelle finden Sie Informationen dazu, bei welchen Modellen Eingabe- und Ausgabetokens separat gezählt werden.
Nächste Schritte
- Informationen zum Aufrufen von APIs für offene Modelle
- Informationen zum Aufrufen der Responses API Call Responses API.