Le paiement à l'usage standard est une option de consommation permettant d'utiliser la suite de modèles d'IA générative de Gemini Enterprise Agent Platform, y compris la famille de modèles Gemini.
Le paiement à l'usage standard vous permet de ne payer que les ressources que vous consommez, sans engagement financier initial. Pour vous aider à faire évoluer les charges de travail sur une capacité partagée, Standard PayGo intègre un système de niveaux d'utilisation. Agent Platform ajuste dynamiquement le seuil de débit prioritaire de votre organisation en fonction de ses dépenses totales pour les services Agent Platform éligibles sur une période glissante de 30 jours. À mesure que les dépenses de votre organisation augmentent, elle est automatiquement promue à des niveaux supérieurs avec des seuils de débit prioritaires plus élevés dans le pool de capacité partagée. Le modèle standard "Pay as you go" s'exécute sur des ressources partagées et ne réserve pas de capacité dédiée ni ne garantit le débit en période de forte contention. Pour les charges de travail nécessitant des performances plus constantes que le paiement à l'usage standard, envisagez le paiement à l'usage prioritaire. Pour la capacité dédiée et garantie, consultez Débit provisionné.
Niveaux d'utilisation et débit
Chaque niveau d'utilisation Standard PayGo définit un seuil de débit prioritaire au niveau de l'organisation, mesuré en jetons par minute (TPM). Les requêtes jusqu'au seuil de TPM de votre niveau bénéficient d'un accès prioritaire à la capacité partagée avant le trafic excédentaire en rafale. Toutefois, le débit et la disponibilité dépendent toujours de la demande en temps réel dans le pool partagé et ne sont pas garantis. Les seuils de débit s'appliquent aux requêtes envoyées au point de terminaison global. Il est recommandé d'utiliser le point de terminaison global, car il permet d'accéder à un pool mondial de capacité de débit et d'acheminer dynamiquement vos requêtes vers l'emplacement le plus disponible.
Les points de terminaison multirégionaux (tels que us et eu sur
aiplatform.us.rep.googleapis.com et aiplatform.eu.rep.googleapis.com) limitent le traitement du machine learning à des limites juridictionnelles spécifiques.
Bien que les points de terminaison multirégionaux regroupent la capacité de plusieurs centres de données dans cette zone géographique, ils fonctionnent à partir de pools de capacité régionaux distincts et ne partagent pas la capacité de débit mondial du point de terminaison global.
Les points de terminaison à une seule région (par exemple, us-central1 ou us-east5) sont limités à un seul cluster de centres de données et disposent de la marge de capacité la plus faible. Si vos charges de travail ne sont pas soumises à des exigences strictes en matière de résidence des données, utilisez le point de terminaison global pour utiliser le seuil de débit prioritaire complet de votre niveau et maximiser la marge. Pour en savoir plus sur la configuration des points de terminaison multirégionaux, consultez Points de terminaison multirégionaux.
Votre trafic n'est pas strictement limité au seuil de TPM de votre niveau. Lorsque de la capacité partagée disponible est disponible, Agent Platform diffuse le trafic qui dépasse ce seuil de manière opportuniste. Pendant les périodes de forte demande sur la plate-forme d'agent, le trafic en rafale excédentaire est limité avant le trafic dans les seuils de niveau. De plus, tout le trafic du pool partagé peut subir une latence plus élevée ou des erreurs 429. Pour minimiser la limitation du débit, répartissez votre trafic de la manière la plus uniforme possible tout au long de chaque minute et évitez d'envoyer des requêtes sous forme de pics brutaux au niveau de la seconde.
Un trafic instantané élevé peut entraîner une limitation du débit, même si votre utilisation moyenne par minute se situe dans le seuil de TPM de votre niveau.
Les niveaux suivants sont disponibles dans le forfait standard à la carte :
| Famille de modèles | Niveau | Dépenses des clients (30 jours) | TPM du trafic (au niveau de l'organisation) |
|---|---|---|---|
| Modèles Gemini Pro | Niveau 1 | 10 $ à 250 $ | 500 000 |
| Niveau 2 | 250 $ à 2 000 $ | 1 000 000 | |
| Niveau 3 | 2 000 $ – 50 000 $ | 2 000 000 | |
| Niveau 4 | > 50 000 $ | 10 000 000 | |
| Niveau personnalisé | Contactez votre équipe commerciale pour en savoir plus | ||
| Modèles Gemini Flash et Flash-Lite | Niveau 1 | 10 $ à 250 $ | 2 000 000 |
| Niveau 2 | 250 $ à 2 000 $ | 4 000 000 | |
| Niveau 3 | 2 000 $ – 50 000 $ | 10 000 000 | |
| Niveau 4 | > 50 000 $ | 50 000 000 | |
| Niveau personnalisé | Contactez votre équipe commerciale pour en savoir plus | ||
Le seuil de débit affiché pour une famille de modèles s'applique indépendamment à chaque modèle de cette famille. Par exemple, une organisation de niveau 3 dispose d'un seuil de débit prioritaire de 10 000 000 TPM pour Gemini 3.5 Flash. L'utilisation par rapport au seuil d'un modèle n'affecte pas le débit des autres modèles. Il n'existe pas de limite distincte de requêtes par minute (RPM) pour chaque niveau. Les requêtes Gemini avec des entrées multimodales sont soumises aux limites de débit du système correspondantes.
Fonctionnement des niveaux d'utilisation
Votre niveau d'utilisation est automatiquement déterminé par les dépenses totales de votre organisation pour les services éligibles de la plate-forme Agent au cours d'une période glissante de 30 jours. À mesure que les dépenses de votre organisation augmentent, le système vous fait passer à un niveau supérieur avec des seuils de débit plus élevés.
Calcul des dépenses
Ce calcul inclut un large éventail de services, des prédictions sur toutes les familles de modèles Gemini aux instances CPU, GPU et TPU d'Agent Platform, ainsi que les SKU basés sur l'engagement, tels que le débit provisionné.
Cliquez pour en savoir plus sur les SKU inclus dans le calcul des dépenses.
Le tableau suivant liste les catégories de Google Cloud SKU incluses dans le calcul des dépenses totales.
| Catégorie | Description des SKU inclus |
|---|---|
| Modèles Gemini | Toutes les familles de modèles Gemini (telles que 2.0, 2.5 et 3.0 dans les versions Pro, Flash et Lite) pour les prédictions dans toutes les modalités (texte, image, audio, vidéo), y compris les variantes par lot, à contexte long, ajustées et "de réflexion" |
| Fonctionnalités des modèles Gemini | Tous les SKU Gemini associés aux fonctionnalités telles que la mise en cache, le stockage du cache et les niveaux de priorité, pour toutes les modalités et versions de modèle |
| CPU de la plate-forme d'agent | Prédictions en ligne et par lot sur toutes les familles d'instances basées sur le processeur (telles que C2, C3, E2, N1, N2 et leurs variantes) |
| GPU Agent Platform | Prédictions en ligne et par lot sur toutes les instances accélérées par GPU NVIDIA (comme les séries A100, H100, H200, B200, L4, T4, V100 et RTX) |
| Agent Platform TPU | Prédictions en ligne et par lot sur toutes les instances basées sur des TPU (telles que TPU-v5e et v6e) |
| Gestion et frais | Tous les SKU de "Frais de gestion" associés à différentes instances de prédiction Agent Platform |
| Débit provisionné | Tous les SKU basés sur l'engagement pour le débit provisionné |
| Autres Services | Services spécialisés tels que "Ancrage LLM pour Gemini… avec l'outil Recherche Google" |
Vérifier le niveau d'utilisation
Pour vérifier le niveau d'utilisation de votre organisation, accédez au tableau de bord Agent Platform dans la console Google Cloud .
Pour afficher le niveau d'utilisation dans le tableau de bord, vous devez disposer du rôle Lecteur Agent Platform (roles/aiplatform.viewer) sur le projet et du rôle Lecteur de compte de facturation (roles/billing.viewer) sur le compte de facturation.
Accéder au tableau de bord Agent Platform
Vérifier les dépenses
Pour examiner vos dépenses Agent Platform, accédez à Cloud Billing dans la consoleGoogle Cloud . Les dépenses sont agrégées au niveau de l'organisation.
Erreurs "Ressource épuisée" (429)
Si vous recevez une erreur 429, cela ne signifie pas que vous avez atteint un quota fixe.
Elle indique une forte contention temporaire pour une ressource partagée spécifique.
Implémentez une stratégie de nouvelle tentative avec intervalle exponentiel entre les tentatives pour gérer ces erreurs, car la disponibilité dans cet environnement dynamique peut changer rapidement.
En plus d'une stratégie de réessai, évaluez votre choix de point de terminaison :
- Point de terminaison
global(recommandé) : le point de terminaisonglobalachemine dynamiquement les requêtes vers le parc mondial de centres de données de Google, en regroupant la capacité de débit globale et en lissant les pics localisés. Cela offre la plus haute disponibilité et réduit considérablement la probabilité d'erreurs429. - Points de terminaison multirégionaux (tels que
useteu) : les points de terminaison multirégionaux regroupent la capacité de plusieurs centres de données dans une limite géographique spécifique. Bien qu'elles offrent une capacité supérieure à celle d'une seule région, elles n'accèdent pas à la capacité mondiale. Si votre application utilise un point de terminaison multirégional et rencontre des erreurs429pendant les périodes de pointe, évaluez si vos règles de gouvernance des données autorisent le routage des charges de travail non sensibles ou générales vers le point de terminaisonglobal, ou envisagez d'utiliser Priority PayGo ou Débit provisionné. - Points de terminaison à région unique (tels que
us-central1) : les points de terminaison à région unique sont limités à un emplacement de cluster spécifique et sont les plus susceptibles de rencontrer des erreurs429en cas de contention de charge. Évitez d'épingler les charges de travail standards à haut débit avec paiement à l'utilisation à des points de terminaison à une seule région, sauf si cela est nécessaire pour la colocation avec des ressources de calcul sensibles à la latence.
Pour de meilleurs résultats, combinez l'utilisation du point de terminaison global avec le lissage du trafic. Évitez d'envoyer des requêtes en pics brusques de niveau 2, car un trafic instantané élevé peut entraîner une limitation du débit, même si votre utilisation moyenne par minute se situe dans le seuil de débit prioritaire de votre niveau. La répartition plus uniforme de vos appels d'API aide le système à gérer votre charge de manière prévisible et améliore les performances globales. Pour en savoir plus sur la gestion des erreurs d'épuisement des ressources, consultez Créer des applications LLM résilientes et réduire les erreurs 429 et Code d'erreur 429.
Modèles compatibles
Les modèles Gemini en disponibilité générale et les modèles affinés supervisés correspondants sont compatibles avec le paiement à l'utilisation standard avec niveaux d'utilisation :
Cliquer pour développer les modèles compatibles
Les modèles Gemini suivants en GA sont également compatibles avec le paiement à l'utilisation standard, mais les niveaux d'utilisation ne s'appliquent pas à ces modèles :
- Gemini Nano Banana 2.1
- Image Flash Gemini 3.1
- Image Gemini 3.1 Flash-Lite
- Gemini 3 Pro Image
- Image Gemini 2.5 Flash
Ces niveaux ne s'appliquent pas aux modèles en preview. Pour obtenir les informations les plus précises et les plus récentes, consultez la documentation officielle spécifique à chaque modèle.
Surveiller le débit et les performances
Pour surveiller la consommation de jetons en temps réel de votre organisation, accédez à l'explorateur de métriques dans Cloud Monitoring.
Accéder à l'explorateur de métriques
Pour en savoir plus sur la surveillance du trafic des points de terminaison de modèle, consultez Surveiller les modèles.
Les niveaux d'utilisation s'appliquent au niveau de l'organisation. Pour savoir comment définir votre champ d'application de l'observabilité afin de représenter le débit sous forme de graphique pour plusieurs projets de votre organisation, consultez Configurer des champs d'application de l'observabilité pour les requêtes multiprojets.
Étapes suivantes
Quotas et limites d'Agent Platform
Quotas et limites liés à Agent Platform, à l'exclusion des limites spécifiques aux produits.
Google Cloud quotas
Découvrez comment Google Cloud limite la quantité d'une ressource que votre projet Google Cloud peut utiliser, et comment les quotas s'appliquent à différents types de ressources, y compris les composants matériels, logiciels et réseau.