Ce document liste les quotas et limites système qui s'appliquent aux modèles d'IA générative sur Agent Platform.
- Les quotas ont des valeurs par défaut, mais vous pouvez généralement demander des ajustements.
- Les limites système sont des valeurs fixes qui ne peuvent pas être modifiées.
Google Cloud utilise des quotas pour garantir l'équité et réduire les pics d'utilisation et de disponibilité des ressources. Un quota limite la quantité d'une ressourceGoogle Cloud que votre projet Google Cloud peut utiliser. Les quotas s'appliquent à différents types de ressources, y compris les composants matériels, logiciels et réseau. Par exemple, ils peuvent limiter le nombre d'appels d'API à un service, le nombre d'équilibreurs de charge utilisés simultanément par votre projet ou le nombre de projets que vous pouvez créer. Ils protègent la communauté des utilisateurs deGoogle Cloud en empêchant la surcharge des services. Les quotas vous aident également à gérer vos propres ressources Google Cloud .
Le système Cloud Quotas permet d'effectuer les opérations suivantes :
- Surveiller votre consommation de produits et services Google Cloud
- Limiter votre consommation de ces ressources
- Demander des modifications de la valeur du quota et automatiser les ajustements de quota
Dans la plupart des cas, lorsque vous tentez d'utiliser une ressource plus que son quota ne le permet, le système bloque l'accès à la ressource et la tâche que vous essayez d'effectuer échoue.
Les quotas s'appliquent généralement au niveau du projet Google Cloud . Votre utilisation d'une ressource dans un projet n'affecte pas votre quota disponible dans un autre projet. Dans un projet Google Cloud , les quotas sont partagés entre toutes les applications et adresses IP.
Pour en savoir plus, consultez la présentation des quotas Cloud.
Des limites système s'appliquent également aux ressources Agent Platform. Elles ne peuvent pas être modifiées.
Des limites s'appliquent également aux ressources Gemini Enterprise Agent Platform. Les limites système ne peuvent pas être modifiées.
Quotas de modèles réglés
L'inférence du modèle réglé partage le même quota que le modèle de base. Il n'existe pas de quota distinct pour l'inférence de modèles ajustés.
Limites d'intégration
Les requêtes pourgemini-embedding-001 et gemini-embedding-2 sont soumises à des quotas mondiaux.
| Modèle de base | Quota | Métrique |
|---|---|---|
| base_model: gemini-embedding | 100 000 000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding | 100 000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200 000 000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60 000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
Les requêtes pour gemini-embedding-001 utilisant l'API predict sont également soumises aux quotas suivants :
| Modèle de base | Quota | Métrique |
|---|---|---|
| base_model : N/A | 30 000 | aiplatform.googleapis.com/online_prediction_requests |
Quotas Agent Runtime
Les quotas suivants s'appliquent à Agent Runtime pour un projet donné dans chaque région :| Description | Quota | Métrique |
|---|---|---|
| Créer, supprimer ou mettre à jour des ressources Agent Runtime par minute | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| Créer, supprimer ou mettre à jour des sessions Agent Runtime par minute | 100 | aiplatform.googleapis.com/session_write_requests |
| Obtenir, lister ou récupérer les sessions Agent Runtime par minute | 10000 | aiplatform.googleapis.com/session_read_requests |
Query ou StreamQuery Agent Runtime par minute
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| Ajouter un événement aux sessions Agent Runtime par minute | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Nombre maximal de ressources Agent Runtime | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Créer, supprimer ou mettre à jour les ressources de mémoire Agent Runtime par minute | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| Obtenir, lister ou récupérer des données de la Memory Bank d'Agent Runtime par minute | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| Requêtes d'exécution par minute dans l'environnement de bac à sable (exécution de code) | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| Entités de l'environnement de bac à sable (exécution de code) par région | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| Requêtes d'écriture par minute dans l'environnement de bac à sable (exécution de code) | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
Requêtes de publication d'agent A2A telles que sendMessage et cancelTask par minute
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
Requêtes GET de l'agent A2A, comme getTask et getCard, par minute
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
Connexions bidirectionnelles simultanées en direct à l'aide de l'API BidiStreamQuery par minute
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
Quotas d'entrées multimodales
Les quotas suivants s'appliquent aux entrées multimodales pour les requêtesgenerateContent et streamGenerateContent pour un projet donné dans chaque région. Chaque quota est appliqué par modèle de base et par résolution. Les mêmes limites s'appliquent aux requêtes traitées par le point de terminaison mondial, à l'aide de la métrique ..._global correspondante.
| Description | Quota | Métrique |
|---|---|---|
| Requêtes de génération de contenu avec entrée d'image par minute, par modèle de base et par résolution | 34 000 000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| Requêtes de génération de contenu avec entrée vidéo par minute, par modèle de base et par résolution | 192 000 000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| Générer des requêtes de contenu avec une entrée audio par minute, par modèle de base et par résolution | 11 000 000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| Requêtes de génération de contenu avec entrée de document par minute, par modèle de base et par résolution | 1 200 000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
Pour demander une limite plus élevée pour ces quotas, contactez l'équipe de votre compte Google Cloud. Vous ne pouvez pas les augmenter depuis la console Google Cloud .
Quotas de contenus multimédias génératifs
Pour afficher et modifier les quotas de contenus génératifs dans la console Google Cloud , procédez comme suit :
- Assurez-vous d'avoir activé l'API Agent Platform pour votre projet. Si l'API n'est pas activée, les quotas Agent Platform ne s'affichent pas.
-
Accédez à la page Quotas et limites du système.
-
Dans la zone de texte Filtre, saisissez les requêtes suivantes :
Metric: METRIC_NAME
Dimensions (e.g. location): MODEL_NAMERemplacez les éléments suivants :
-
METRIC_NAME : nom de la métrique à rechercher (l'un des suivants) :
-
Gemini Omni :
global_generate_content_requests_per_minute_per_project_per_base_model -
Veo :
long_running_online_prediction_requests_per_base_model -
Lyria :
global_generate_content_requests_per_minute_per_project_per_base_model
-
Gemini Omni :
- MODEL_NAME : nom du modèle que vous utilisez.
-
METRIC_NAME : nom de la métrique à rechercher (l'un des suivants) :
- Pour ajuster le quota, cliquez sur Plus, puis sélectionnez Modifier le quota.
- Saisissez une nouvelle valeur de quota dans le volet, puis cliquez sur Envoyer la demande.
Inférence par lot
Les quotas et les limites des jobs d'inférence par lot sont les mêmes dans toutes les régions.Limites de jobs d'inférence par lot simultanés pour les modèles Gemini
Il n'existe pas de limites de quota prédéfinies pour l'inférence par lot pour les modèles Gemini. Au lieu de cela, le service de traitement par lot donne accès à un grand pool de ressources partagées, allouées dynamiquement en fonction de la disponibilité en temps réel du modèle et de la demande pour ce modèle auprès de tous les clients. Lorsque davantage de clients sont actifs et que la capacité du modèle est saturée, vos requêtes par lot peuvent être mises en file d'attente en raison de la capacité.Quotas de jobs d'inférence par lot simultanés pour les modèles autres que Gemini
Le tableau suivant répertorie les quotas pour le nombre de jobs d'inférence par lot simultanés, qui ne s'appliquent pas aux modèles Gemini :| Quota | Valeur |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
Afficher et modifier les quotas dans la console Google Cloud
Pour afficher et modifier les quotas dans la console Google Cloud , procédez comme suit :- Accédez à la page Quotas et limites du système.
- Pour ajuster le quota, copiez et collez la propriété
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsdans le filtre. Appuyez sur Entrée. - Cliquez sur les trois points à la fin de la ligne, puis sélectionnez Modifier le quota.
- Saisissez une nouvelle valeur de quota dans le volet, puis cliquez sur Envoyer la demande.
Accéder à la page "Quotas et limites du système"
Quotas pour les règles de gouvernance sémantique
Les quotas suivants s'appliquent à la Règle de gouvernance sémantique pour un projet donné dans chaque région :| Description | Quota | Métrique |
|---|---|---|
| Obtenir ou lister les ressources de règles de gouvernance sémantique par minute | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| Nombre d'opérations Créer, Mettre à jour, Supprimer de ressources de règles de gouvernance sémantique par minute | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| Obtenir les ressources du moteur de règles de gouvernance sémantique par minute | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| Mettre à jour ou supprimer les ressources du moteur de règles de gouvernance sémantique par minute | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| Nombre de ressources de règles de gouvernance sémantique par projet et par emplacement. | 1 000 | aiplatform.googleapis.com/semantic_governance/policy_count |
Afficher et modifier les quotas dans la console Google Cloud
Pour afficher et modifier les quotas dans la console Google Cloud , procédez comme suit :- Accédez à la page Quotas et limites du système.
- Pour ajuster le quota, copiez et collez la propriété
aiplatform.googleapis.com/semantic_governance/policy_write_requestsdans le filtre. Appuyez sur Entrée. - Cliquez sur les trois points à la fin de la ligne, puis sélectionnez Modifier le quota.
- Saisissez une nouvelle valeur de quota dans le volet, puis cliquez sur Envoyer la demande.
Accéder à la page "Quotas et limites du système"
Moteur RAG sur Gemini Enterprise Agent Platform
Pour que chaque service effectue une génération augmentée par récupération (RAG) à l'aide du moteur RAG, les quotas suivants s'appliquent. Ils sont mesurés en requêtes par minute (RPM).| Service | Quota | Métrique |
|---|---|---|
| API de gestion des données du moteur RAG | 60 tr/min | VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 tr/min | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1 500 RPM | Online prediction requests per base model per minute per region per base_modelUn autre filtre que vous pouvez spécifier est base_model: textembedding-gecko |
| Service | Limite | Métrique |
|---|---|---|
Requêtes ImportRagFiles simultanées |
3 RPM | VertexRagService concurrent import requests per region |
Nombre maximal de fichiers par requête ImportRagFiles |
10 000 | VertexRagService import rag files requests per region |
Gen AI Evaluation Service
Le service d'évaluation de l'IA générative utilise Gemini 2.5 Flash comme modèle d'évaluation par défaut pour les métriques basées sur les modèles. Une seule requête d'évaluation pour une métrique basée sur un modèle peut entraîner plusieurs requêtes sous-jacentes adressées à Gen AI Evaluation Service. La consommation de chaque modèle est calculée au niveau de l'organisation. Cela signifie que toutes les requêtes dirigées vers le modèle d'évaluation pour l'inférence de modèle et l'évaluation basée sur les modèles contribuent à la consommation du modèle. Les quotas pour le service d'évaluation de l'IA générative et le modèle d'évaluation sous-jacent sont indiqués dans le tableau suivant :| Demander un quota | Quota par défaut |
|---|---|
| Requêtes de Gen AI Evaluation Service par minute | 1 000 requêtes par projet et par région |
| Débit Gemini | Dépend du modèle et de l'option de consommation |
| Exécutions d'évaluation simultanées | 20 exécutions d'évaluation simultanées par projet et par région |
Si vous recevez une erreur liée aux quotas lors de l'utilisation du service d'évaluation Gen AI, vous devrez peut-être envoyer une demande d'augmentation de quota. Pour en savoir plus, consultez Afficher et gérer les quotas.
| Limite | Valeur |
|---|---|
| Délai avant expiration de la requête Gen AI Evaluation Service | 60 secondes |
Lorsque vous utilisez le service d'évaluation de l'IA générative pour la première fois dans un nouveau projet, vous pouvez rencontrer un délai de configuration initiale de deux minutes. Si votre première requête échoue, attendez quelques minutes, puis réessayez. Les requêtes d'évaluation ultérieures sont généralement traitées dans un délai de 60 secondes.
Le nombre maximal de jetons d'entrée et de sortie pour les métriques basées sur un modèle dépend du modèle utilisé en tant que modèle de jugement. Pour obtenir la liste des modèles, consultez Modèles Google.
Quotas des pipelines Gemini Enterprise Agent Platform
Chaque tâche de réglage utilise Gemini Enterprise Agent Platform Pipelines. Pour en savoir plus, consultez les quotas et limites d'Agent Platform Pipelines.
Étapes suivantes
Standard PayGo
Découvrez le paiement à l'usage standard, une option de consommation Agent Platform qui vous permet de ne payer que les ressources que vous consommez, sans engagement financier initial.
Quotas et limites du système Agent Platform
Quotas et limites du système liés à Agent Platform, à l'exclusion des quotas et limites du système spécifiques aux produits.
Quotas Google Cloud
Découvrez comment Google Cloud limite la quantité d'une ressource que votre projet Google Cloud peut utiliser, et comment les quotas s'appliquent à différents types de ressources, y compris les composants matériels, logiciels et réseau.