Modèles Grok xAI

Les modèles Grok de xAI sont disponibles en tant qu'API gérées sur Gemini Enterprise Agent Platform. Vous pouvez diffuser vos réponses en streaming pour réduire la perception de la latence côté utilisateur. Une réponse en flux continu utilise des événements envoyés par le serveur (SSE) pour diffuser la réponse de manière incrémentielle.

Modèles xAI gérés

Les modèles suivants sont disponibles auprès de xAI pour une utilisation dans Gemini Enterprise Agent Platform. Pour accéder à un modèle xAI, accédez à sa fiche de modèle Model Garden.

Grok 4.7 Modèle très performant de xAI, conçu pour le codage et le travail intellectuel. Il travaille plus longtemps sur les tâches difficiles et vérifie son propre travail.
Grok 4.6 Modèle très performant de xAI, conçu pour le codage, les tâches agentiques et le travail intellectuel.
Grok 4.3 Un modèle hautes performances de xAI.
Grok 4.20 (raisonnement) Modèle hautes performances de xAI, avec un faible taux d'hallucinations. Ce modèle excelle dans les tâches de compréhension de documents et l'appel d'outils agentiques à long terme.
Grok 4.20 (sans raisonnement) Modèle sans raisonnement hautes performances de xAI, offrant un faible taux d'hallucination. Excellent pour les cas d'utilisation sensibles à la latence, comme l'assistance client et la catégorisation.
Grok 4.1 Fast (Reasoning) (Obsolète) Modèle économique de xAI, bénéficiant de solides capacités d'appel d'outils et permettant une synthèse efficace des bases de connaissances. Excellent pour les tâches de recherche impliquant des données Web et des outils de base de connaissances internes.
Grok 4.1 Fast (sans raisonnement) (Obsolète) Modèle sans raisonnement économique de xAI, optimisé pour offrir de bonnes performances et une faible latence. Il excelle dans les tâches à volume élevé, comme la synthèse et la catégorisation.

Utiliser des modèles XAI

Pour savoir comment effectuer des appels en flux continu et non en flux continu aux modèles xAI, consultez Appeler des API de modèles ouverts.

Pour les modèles gérés, vous pouvez utiliser des commandes curl pour envoyer des requêtes au point de terminaison Gemini Enterprise Agent Platform en utilisant les noms de modèles suivants :

  • Pour Grok 4.7, utilisez grok-4.7.
  • Pour Grok 4.6, utilisez grok-4.6.
  • Pour Grok 4.3, utilisez grok-4.3.
  • Pour Grok 4.20 (raisonnement), utilisez grok-4.20-reasoning.
  • Pour Grok 4.20 (non-raisonnement), utilisez grok-4.20-non-reasoning.
  • Pour Grok 4.1 Fast (raisonnement), utilisez grok-4.1-fast-reasoning.
  • Pour Grok 4.1 Fast (sans raisonnement), utilisez grok-4.1-fast-non-reasoning.

Quotas Grok

Les modèles Grok disposent d'un quota mondial unique qui s'applique par modèle de base plutôt que par point de terminaison. Les requêtes envoyées au point de terminaison mondial et au point de terminaison multirégional des États-Unis sont soumises à la même limite sous-jacente. Le quota est spécifié en requêtes par minute (RPM) et en jetons par minute (TPM), où les TPM incluent à la fois les jetons d'entrée et de sortie.

Dans l'optique de maintenir les performances globales du service et une utilisation acceptable, les quotas maximaux peuvent varier en fonction du compte et, dans certains cas, l'accès peut être limité. Consultez les quotas de votre projet sur la page Quotas et limites du système de la console Google Cloud . Vous devez également disposer des quotas suivants :

  • global_generate_content_requests_per_minute_per_project_per_base_model définit votre quota de requêtes par minute.

  • Pour les TPM, deux valeurs de quota s'appliquent à des modèles spécifiques : global_generate_content_input_tokens_per_minute_per_base_model définit le quota de TPM d'entrée et global_generate_content_output_tokens_per_minute_per_base_model définit le quota de TPM de sortie.

Pour savoir quels modèles comptent les jetons d'entrée et de sortie séparément, consultez les pages spécifiques à chaque modèle.

Étapes suivantes