Les modèles Grok de xAI sont disponibles en tant qu'API gérées sur Gemini Enterprise Agent Platform. Vous pouvez diffuser vos réponses en streaming pour réduire la perception de la latence côté utilisateur. Une réponse en flux continu utilise des événements envoyés par le serveur (SSE) pour diffuser la réponse de manière incrémentielle.
Modèles xAI gérés
Les modèles suivants sont disponibles auprès de xAI pour une utilisation dans Gemini Enterprise Agent Platform. Pour accéder à un modèle xAI, accédez à sa fiche de modèle Model Garden.
Utiliser des modèles XAI
Pour savoir comment effectuer des appels en flux continu et non en flux continu aux modèles xAI, consultez Appeler des API de modèles ouverts.
Pour les modèles gérés, vous pouvez utiliser des commandes curl pour envoyer des requêtes au point de terminaison Gemini Enterprise Agent Platform en utilisant les noms de modèles suivants :
- Pour Grok 4.7, utilisez
grok-4.7. - Pour Grok 4.6, utilisez
grok-4.6. - Pour Grok 4.3, utilisez
grok-4.3. - Pour Grok 4.20 (raisonnement), utilisez
grok-4.20-reasoning. - Pour Grok 4.20 (non-raisonnement), utilisez
grok-4.20-non-reasoning. - Pour Grok 4.1 Fast (raisonnement), utilisez
grok-4.1-fast-reasoning. - Pour Grok 4.1 Fast (sans raisonnement), utilisez
grok-4.1-fast-non-reasoning.
Quotas Grok
Les modèles Grok disposent d'un quota mondial unique qui s'applique par modèle de base plutôt que par point de terminaison. Les requêtes envoyées au point de terminaison mondial et au point de terminaison multirégional des États-Unis sont soumises à la même limite sous-jacente. Le quota est spécifié en requêtes par minute (RPM) et en jetons par minute (TPM), où les TPM incluent à la fois les jetons d'entrée et de sortie.
Dans l'optique de maintenir les performances globales du service et une utilisation acceptable, les quotas maximaux peuvent varier en fonction du compte et, dans certains cas, l'accès peut être limité. Consultez les quotas de votre projet sur la page Quotas et limites du système de la console Google Cloud . Vous devez également disposer des quotas suivants :
global_generate_content_requests_per_minute_per_project_per_base_modeldéfinit votre quota de requêtes par minute.Pour les TPM, deux valeurs de quota s'appliquent à des modèles spécifiques :
global_generate_content_input_tokens_per_minute_per_base_modeldéfinit le quota de TPM d'entrée etglobal_generate_content_output_tokens_per_minute_per_base_modeldéfinit le quota de TPM de sortie.
Pour savoir quels modèles comptent les jetons d'entrée et de sortie séparément, consultez les pages spécifiques à chaque modèle.
Étapes suivantes
- Découvrez comment appeler les API de modèles ouverts.
- Découvrez comment utiliser l'API Call Responses.