Quotas et limites système de l'IA générative sur Gemini Enterprise Agent Platform

Cette page fournit une liste des quotas par région et par modèle, et vous explique comment afficher et modifier vos quotas dans la console Google Cloud .

Quotas de modèles réglés

L'inférence de modèle réglé partage le même quota que le modèle de base. Il n'existe pas de quota distinct pour l'inférence de modèles ajustés.

Limites d'intégration

Les requêtes pour gemini-embedding-001 sont soumises à des quotas régionaux, tandis que celles pour gemini-embedding-2 sont soumises à des quotas mondiaux.
Modèle de base Quota Métrique
base_model: gemini-embedding 100 000 000 aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 200 000 000 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 60 000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model

Les requêtes pour gemini-embedding-001 à l'aide de l'API predict sont également soumises aux quotas suivants :

Modèle de base Quota Métrique
base_model: gemini-embedding 100 000 aiplatform.googleapis.com/online_prediction_requests_per_base_model
base_model : N/A 30 000 aiplatform.googleapis.com/online_prediction_requests

Quotas Agent Runtime

Les quotas suivants s'appliquent à Agent Runtime pour un projet donné dans chaque région :
Description Quota Métrique
Créer, supprimer ou mettre à jour des ressources Agent Runtime par minute 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
Créer, supprimer ou mettre à jour des sessions Agent Runtime par minute 100 aiplatform.googleapis.com/session_write_requests
Obtenir, lister ou récupérer les sessions Agent Runtime par minute 10000 aiplatform.googleapis.com/session_read_requests
Query ou StreamQuery Agent Runtime par minute 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
Ajouter un événement aux sessions Agent Runtime par minute 300 aiplatform.googleapis.com/session_event_append_requests
Nombre maximal de ressources Agent Runtime 100 aiplatform.googleapis.com/reasoning_engine_service_entities
Créer, supprimer ou mettre à jour les ressources de mémoire Agent Runtime par minute 100 aiplatform.googleapis.com/memory_bank_write_requests
Obtenir, lister ou récupérer des données depuis la Memory Bank d'Agent Runtime par minute 300 aiplatform.googleapis.com/memory_bank_read_requests
Requêtes d'exécution dans l'environnement bac à sable (exécution de code) par minute 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
Entités d'environnement de bac à sable (exécution de code) par région 1000 aiplatform.googleapis.com/sandbox_environment_entities
Requêtes d'écriture par minute dans l'environnement de bac à sable (exécution de code) 500 aiplatform.googleapis.com/sandbox_environment_write_requests
Requêtes de publication d'agent A2A telles que sendMessage et cancelTask par minute 60 aiplatform.googleapis.com/a2a_agent_post_requests
Requêtes GET d'agent A2A telles que getTask et getCard par minute 600 aiplatform.googleapis.com/a2a_agent_get_requests
Connexions bidirectionnelles simultanées en direct à l'aide de l'API BidiStreamQuery par minute 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

Quotas d'entrées multimodales

Les quotas suivants s'appliquent aux entrées multimodales pour les requêtes generateContent et streamGenerateContent pour un projet donné dans chaque région. Chaque quota est appliqué par modèle de base et par résolution. Les mêmes limites s'appliquent aux requêtes traitées par le point de terminaison mondial, à l'aide de la métrique ..._global correspondante.
Description Quota Métrique
Requêtes de génération de contenu avec entrée d'image par minute, par modèle de base et par résolution 34 000 000 aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution
Requêtes de génération de contenu avec entrée vidéo par minute, par modèle de base et par résolution 192 000 000 aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution
Requêtes de génération de contenu avec entrée audio par minute, par modèle de base et par résolution 11 000 000 aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution
Requêtes de génération de contenu avec entrée de document par minute, par modèle de base et par résolution 1 200 000 aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution

Pour demander une augmentation de la limite de ces quotas, contactez l'équipe de gestion de votre compte Google Cloud. Vous ne pouvez pas les augmenter depuis la console Google Cloud .

Inférence par lot

Les quotas et les limites des jobs d'inférence par lot sont les mêmes dans toutes les régions.

Limites de tâches d'inférence par lot simultanées pour les modèles Gemini

Il n'existe aucune limite de quota prédéfinie pour l'inférence par lot pour les modèles Gemini. Au lieu de cela, le service de traitement par lot donne accès à un grand pool de ressources partagées, allouées de manière dynamique en fonction de la disponibilité en temps réel du modèle et de la demande pour ce modèle auprès de tous les clients. Lorsque davantage de clients sont actifs et que la capacité du modèle est saturée, vos requêtes par lot peuvent être mises en file d'attente en raison de la capacité.

Quotas de tâches d'inférence par lot simultanées pour les modèles non Gemini

Le tableau suivant répertorie les quotas pour le nombre de jobs d'inférence par lot simultanés, qui ne s'appliquent pas aux modèles Gemini :
Quota Valeur
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs 4
Si le nombre de tâches envoyées dépasse le quota alloué, elles sont placées dans une file d'attente et traitées lorsque la capacité de quota devient disponible.

Afficher et modifier les quotas dans la console Google Cloud

Pour afficher et modifier les quotas dans la console Google Cloud , procédez comme suit :
  1. Accédez à la page Quotas et limites du système.
  2. Accéder à la page "Quotas et limites du système"

  3. Pour ajuster le quota, copiez et collez la propriété aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs dans le Filtre. Appuyez sur Entrée.
  4. Cliquez sur les trois points à la fin de la ligne, puis sélectionnez Modifier le quota.
  5. Saisissez une nouvelle valeur de quota dans le volet, puis cliquez sur Envoyer la demande.

Quotas pour les règles de gouvernance sémantique

Les quotas suivants s'appliquent au Règlement sur la gouvernance sémantique pour un projet donné dans chaque région :
Description Quota Métrique
Obtenir ou lister les ressources de règles de gouvernance sémantique par minute 600 aiplatform.googleapis.com/semantic_governance/policy_read_requests
Nombre d'opérations de création, de mise à jour ou de suppression de ressources de règles de gouvernance sémantique par minute 60 aiplatform.googleapis.com/semantic_governance/policy_write_requests
Obtenir les ressources du moteur de règles de gouvernance sémantique par minute 600 aiplatform.googleapis.com/semantic_governance/engine_read_requests
Mettre à jour ou supprimer les ressources du moteur de règles de gouvernance sémantique par minute 60 aiplatform.googleapis.com/semantic_governance/engine_write_requests
Nombre de ressources de règles de gouvernance sémantique par projet et par emplacement. 1 000 aiplatform.googleapis.com/semantic_governance/policy_count

Afficher et modifier les quotas dans la console Google Cloud

Pour afficher et modifier les quotas dans la console Google Cloud , procédez comme suit :
  1. Accédez à la page Quotas et limites du système.
  2. Accéder à la page "Quotas et limites du système"

  3. Pour ajuster le quota, copiez et collez la propriété aiplatform.googleapis.com/semantic_governance/policy_write_requests dans le Filtre. Appuyez sur Entrée.
  4. Cliquez sur les trois points à la fin de la ligne, puis sélectionnez Modifier le quota.
  5. Saisissez une nouvelle valeur de quota dans le volet, puis cliquez sur Envoyer la demande.

Moteur RAG sur Gemini Enterprise Agent Platform

Pour que chaque service effectue une génération augmentée par récupération (RAG) à l'aide du moteur RAG, les quotas suivants s'appliquent. Ils sont mesurés en requêtes par minute (RPM).
Service Quota Métrique
API de gestion des données du moteur RAG 60 tr/min VertexRagDataService requests per minute per region
RetrievalContexts API 600 tr/min VertexRagService retrieve requests per minute per region
base_model: textembedding-gecko 1 500 RPM Online prediction requests per base model per minute per region per base_model

Un autre filtre que vous pouvez spécifier est base_model: textembedding-gecko
Les limites suivantes s'appliquent :
Service Limite Métrique
Requêtes ImportRagFiles simultanées 3 RPM VertexRagService concurrent import requests per region
Nombre maximal de fichiers par requête ImportRagFiles 10 000 VertexRagService import rag files requests per region

Gen AI Evaluation Service

Le service d'évaluation de l'IA générative utilise Gemini 2.5 Flash comme modèle d'évaluation par défaut pour les métriques basées sur les modèles. Une seule requête d'évaluation pour une métrique basée sur un modèle peut entraîner plusieurs requêtes sous-jacentes adressées à Gen AI Evaluation Service. La consommation de chaque modèle est calculée au niveau de l'organisation. Cela signifie que toutes les requêtes dirigées vers le modèle d'évaluation pour l'inférence de modèle et l'évaluation basée sur les modèles contribuent à la consommation du modèle. Les quotas pour le service d'évaluation de l'IA générative et le modèle d'évaluation sous-jacent sont indiqués dans le tableau suivant :
Demander un quota Quota par défaut
Requêtes de Gen AI Evaluation Service par minute 1 000 requêtes par projet et par région
Débit de Gemini Dépend du modèle et de l'option de consommation
Exécutions d'évaluation simultanées 20 exécutions d'évaluation simultanées par projet et par région

Si vous recevez une erreur liée aux quotas lors de l'utilisation du service d'évaluation de l'IA générative, vous devrez peut-être envoyer une demande d'augmentation de quota. Pour en savoir plus, consultez Afficher et gérer les quotas.

Limite Valeur
Délai avant expiration de la requête Gen AI Evaluation Service 60 secondes

Lorsque vous utilisez le service d'évaluation de l'IA générative pour la première fois dans un nouveau projet, vous pouvez rencontrer un délai de configuration initiale de deux minutes. Si votre première requête échoue, attendez quelques minutes, puis réessayez. Les requêtes d'évaluation ultérieures sont généralement traitées dans un délai de 60 secondes.

Le nombre maximal de jetons d'entrée et de sortie pour les métriques basées sur un modèle dépend du modèle utilisé en tant que modèle de jugement. Pour obtenir la liste des modèles, consultez Modèles Google.

Quotas des pipelines Gemini Enterprise Agent Platform

Chaque tâche de réglage utilise les pipelines Gemini Enterprise Agent Platform. Pour en savoir plus, consultez les quotas et limites d'Agent Platform Pipelines.

Étapes suivantes

Présentation

Découvrez le paiement à l'utilisation standard, une option de consommation de l'Agent Platform qui vous permet de ne payer que les ressources que vous consommez, sans engagement financier préalable.

Resource

Quotas et limites du système liés à Agent Platform, à l'exclusion des quotas et limites du système spécifiques aux produits.

Présentation

Découvrez comment Google Cloud limite la quantité d'une ressource que votre projet Google Cloud peut utiliser, et comment les quotas s'appliquent à différents types de ressources, y compris les composants matériels, logiciels et réseau.