Quotas et limites du système

Ce document répertorie les quotas et limites système qui s'appliquent à Model Armor.

  • Les quotas ont des valeurs par défaut, mais vous pouvez généralement demander des ajustements.
  • Les limites système sont des valeurs fixes qui ne peuvent pas être modifiées.

Google Cloud utilise des quotas pour garantir l'équité et réduire les pics d'utilisation et de disponibilité des ressources. Un quota limite la quantité d'une ressourceGoogle Cloud que votre projet Google Cloud peut utiliser. Les quotas s'appliquent à différents types de ressources, y compris les composants matériels, logiciels et réseau. Par exemple, ils peuvent limiter le nombre d'appels d'API à un service, le nombre d'équilibreurs de charge utilisés simultanément par votre projet ou le nombre de projets que vous pouvez créer. Ils protègent la communauté des utilisateurs deGoogle Cloud en empêchant la surcharge des services. Les quotas vous aident également à gérer vos propres ressources Google Cloud .

Le système Cloud Quotas permet d'effectuer les opérations suivantes :

Dans la plupart des cas, lorsque vous tentez d'utiliser une ressource plus que son quota ne le permet, le système bloque l'accès à la ressource et la tâche que vous essayez d'effectuer échoue.

Les quotas s'appliquent généralement au niveau du projet Google Cloud . Votre utilisation d'une ressource dans un projet n'affecte pas votre quota disponible dans un autre projet. Dans un projet Google Cloud , les quotas sont partagés entre toutes les applications et adresses IP.

Pour en savoir plus, consultez la présentation des quotas Cloud.

Quotas de l'API Model Armor

Le tableau suivant indique les quotas de l'API Model Armor.

Quota Valeur
Requêtes API 1 200 requêtes par minute (RPM) par projet
Requêtes envoyées à ExternalProcessor 600 RPM par projet1

Vous pouvez appliquer une valeur comprise entre 0 et 1 200 requêtes par minute par projet. Pour demander un ajustement, consultez Demander un ajustement de quota. Si vous avez besoin d'un quota supérieur à celui par défaut, contactez Cloud Customer Care.

Pour en savoir plus sur les quotas liés aux intégrations Model Armor avec d'autres services, consultez Gérer les quotas.

1 Pertinent si vous intégrez Model Armor à d'autres services Google Cloud .

Taille maximale des fichiers

Le tableau suivant indique la limite système concernant la taille des fichiers et des images d'entrée. Si un fichier ou une image dépasse cette limite, Model Armor ne l'analyse pas.

Limite système Valeur
Tous les fichiers compatibles et les images 4 Mo

Limites de jetons du système

Model Armor applique différentes limites système aux jetons en fonction du filtre spécifique. Ces limites s'appliquent au texte direct dans les requêtes et les réponses, ainsi qu'au texte extrait des fichiers compatibles. Model Armor analyse le texte jusqu'à 65 536 jetons (environ 262 144 caractères) pour détecter l'injection de prompt et le jailbreaking, et appliquer des filtres d'IA responsable et de contenus d'abus sexuels sur mineurs. Un jeton équivaut à environ quatre caractères. Pour en savoir plus sur la façon dont les jetons sont comptabilisés, consultez le guide sur les jetons de l'API Gemini.

Les limites du système de jetons ne s'appliquent pas à la détection des URL malveillantes. Au lieu de cela, Model Armor applique une limite au nombre d'URL analysées. Model Armor extrait les URL jusqu'à ce qu'il atteigne 256 URL ou la fin de la charge utile, et n'analyse que les 256 premières URL trouvées dans les requêtes et les réponses.

Filtre Limite système
Détection de l'injection de prompt et du jailbreaking 65 536
IA responsable 65 536
Contenus d'abus sexuels sur mineurs 65 536
Protection des données sensibles 130 000

Si un filtre détecte une correspondance, il renvoie MATCH_FOUND. Si un filtre ne détecte aucune correspondance, la valeur qu'il renvoie dépend de la limite de jetons du filtre, selon que la requête ou la réponse la dépassent ou non :

  • Si la requête ou la réponse respecte la limite de jetons du filtre, le filtre renvoie NO_MATCH_FOUND.
  • Si la requête ou la réponse dépasse la limite de jetons du filtre, le filtre renvoie EXECUTION_SKIPPED et inclut Detection skipped as token limit exceeded. dans le champ messageItems du résultat du filtre.

Jetons illimités pour le mode de streaming en temps réel

Lorsque vous nettoyez du texte en flux continu en mode temps réel, Model Armor accepte un nombre illimité de jetons. En revanche, le mode de streaming mis en mémoire tampon est soumis aux limites de jetons listées dans le tableau précédent.

Limites du système de règles d'exclusion

Le tableau suivant indique les limites système pour les règles d'exclusion spécifiques aux modèles.

Limite Valeur
Nombre maximal d'ensembles de règles par configuration de filtre 10
Nombre maximal de règles par ensemble de règles 10
Nombre maximal de dictionnaires par demande de modèle 10
Taille maximale de la liste de mots par dictionnaire 128 Ko
Longueur maximale du modèle d'expression régulière 1 000 caractères
Taille maximale du texte d'entrée analysé pour les règles d'exclusion 0,5 Mo

Les règles d'exclusion n'évaluent que les 0,5 Mo initiaux du texte saisi. Si une entrée dépasse 0,5 Mo et qu'un filtre détecte une correspondance qu'une règle d'exclusion ne couvre pas dans la partie analysée initiale, le filtre renvoie EXECUTION_SKIPPED. Pour déterminer si une charge utile a été ignorée en raison de la limite de charge utile d'exclusion ou d'une limite de jetons, inspectez le champ messageItems dans piAndJailbreakFilterResult ou raiFilterResult :

  • Limite de charge utile d'exclusion dépassée : Detection skipped as exclusion rules evaluation failed with reason: Input size exceeded max supported size of 0.5 MB. Exclusion rules execution could not be confirmed on full text.
  • Limite de jetons dépassée : Detection skipped as token limit exceeded.

Le renvoi de EXECUTION_SKIPPED permet d'assurer la sécurité lorsque Model Armor ne peut pas évaluer l'intégralité du contenu par rapport aux règles d'exclusion.

Obtenir les noms des métriques de quota et de limite du système

Les quotas et les limites du système ont deux types de noms : les noms à afficher et les noms de métriques. Les noms à afficher contiennent des espaces et des majuscules pour faciliter la lecture. Les noms de métriques sont plus susceptibles d'être en minuscules et délimités par des traits de soulignement plutôt que par des espaces. Le format exact dépend du service.

Les instructions suivantes expliquent comment obtenir les noms de métriques pour les quotas et les limites système à l'aide de la console Google Cloud ou de gcloud CLI.

Console

  1. Dans la console Google Cloud , accédez à la page IAM et administration> Quotas et limites du système :

    Accéder à la page Quotas et limites du système

    Le tableau sur cette page affiche les quotas et les limites système qui ont une utilisation ou des valeurs ajustées, ainsi qu'une entrée de référence pour les autres quotas. L'entrée de référence comporte le mot "default" (par défaut) entre parenthèses à la fin de la liste dans la colonne Nom. Par exemple, SetIAMPolicy requests per minute per region (default) est l'entrée de référence pour le quota SetIamPolicyRequestsPerMinutePerProject.

  2. Si la colonne Métrique n'apparaît pas, procédez comme suit.

    1. Cliquez sur Options d'affichage des colonnes.
    2. Sélectionnez Metric (Métrique).
    3. Cliquez sur OK. La colonne Métrique s'affiche dans le tableau.

La colonne Métrique affiche les noms des métriques. Pour filtrer les résultats, saisissez le nom ou la valeur d'une propriété dans le champ à côté de Filtrer.

gcloud

Pour obtenir les noms de métriques d'un service Google Cloud à l'aide de la gcloud CLI, exécutez la commande quotas info list. Pour ignorer les lignes qui ne listent pas les noms de métriques, transmettez le résultat à une commande telle que grep avec metric: comme terme de recherche, ou utilisez l'indicateur --format de gcloud CLI :

gcloud beta quotas info list --project=PROJECT_ID_OR_NUMBER \
    --service=SERVICE_NAME --format="value(metric)"

Remplacez les éléments suivants :

  • PROJECT_ID_OR_NUMBER : ID ou numéro du projet.
  • SERVICE_NAME : nom du service dont vous souhaitez afficher les métriques de quota. Par exemple, le nom du service Compute Engine est compute.googleapis.com. Incluez la partie googleapis.com du nom du service.