L'option de paiement à l'utilisation standard (Standard PayGo) est une option de consommation permettant d'utiliser la suite de modèles d'IA générative de Gemini Enterprise Agent Platform, y compris la famille de modèles Gemini.
Avec l'option Standard PayGo, vous ne payez que les ressources que vous consommez, sans engagement financier préalable. Pour offrir des performances plus prévisibles pour les charges de travail évolutives, l'option Standard PayGo intègre un système de niveaux d'utilisation. Agent Platform ajuste dynamiquement la capacité de débit de base de votre organisation en fonction de ses dépenses totales pour les services Agent Platform éligibles sur une période glissante de 30 jours. À mesure que les dépenses de votre organisation augmentent, elle est automatiquement promue à des niveaux supérieurs qui offrent un accès accru aux ressources partagées et des seuils de performances plus élevés. Pour les charges de travail nécessitant des performances plus cohérentes que l'option Standard PayGo, envisagez l'option Priority PayGo. Pour une capacité dédiée et garantie, consultez la section Débit provisionné.
Niveaux d'utilisation et débit
Chaque niveau d'utilisation Standard PayGo vise à fournir un débit de base, mesuré en jetons par minute (TPM), qui sert de plancher de performances prévisible pour le trafic de votre organisation. Les limites de débit sont basées sur les requêtes envoyées au point de terminaison mondial. L'utilisation du point de terminaison mondial est une bonne pratique, car elle permet d'accéder à un pool de capacité de débit multirégional plus important et d'acheminer vos requêtes vers l'emplacement le plus disponible afin de maximiser les performances.
Votre trafic n'est pas strictement limité à la limite de débit de base. Agent Platform permet au trafic de dépasser cette limite au mieux. Toutefois, en période de forte demande sur Agent Platform, ce trafic de pointe excédentaire peut présenter une plus grande variabilité des performances. Pour optimiser les performances et minimiser le risque de recevoir ces erreurs, il est également recommandé de lisser votre trafic aussi uniformément que possible chaque minute. Évitez d'envoyer des requêtes en pics nets de second niveau. Un trafic élevé et instantané peut entraîner une limitation, même si votre utilisation moyenne par minute est inférieure à votre limite. Une répartition plus uniforme de vos appels d'API aide le système à gérer votre charge de manière prévisible et améliore les performances globales.
Les niveaux suivants sont disponibles dans l'option Standard PayGo :
| Famille de modèles | Niveau | Dépenses du client (30 jours) | Trafic TPM (au niveau de l'organisation) |
|---|---|---|---|
| Modèles Gemini Pro | Niveau 1 | 10 $ à 250 $ | 500 000 |
| Niveau 2 | 250 $ à 2 000 $ | 1 000 000 | |
| Niveau 3 | > 2 000 $ | 2 000 000 | |
| Modèles Gemini Flash et Flash-Lite | Niveau 1 | 10 $ à 250 $ | 2 000 000 |
| Niveau 2 | 250 $ à 2 000 $ | 4 000 000 | |
| Niveau 3 | > 2 000 $ | 10 000 000 |
Notez que la limite de débit affichée pour une famille de modèles s'applique indépendamment à chaque modèle de cette famille. Par exemple, un client de niveau 3 dispose d'un débit de base de 10 000 000 de TPM pour Gemini 2.5 Flash. L'utilisation d'une de ces limites n'a pas d'incidence sur le débit des autres modèles. Il n'existe pas de limite distincte de requêtes par minute (RPM) pour chaque niveau. Toutefois, la limite système de 30 000 RPM par modèle et par région s'applique. Les requêtes Gemini avec des entrées multimodales sont soumises à les limites de débit système correspondantes, y compris les images, l'audio, la vidéo, et les documents.
Fonctionnement des niveaux d'utilisation
Votre niveau d'utilisation est automatiquement déterminé par les dépenses totales de votre organisation pour les services Agent Platform éligibles sur une période glissante de 30 jours. À mesure que les dépenses de votre organisation augmentent, le système vous fait passer à un niveau supérieur avec un débit plus élevé.
Calcul des dépenses
Ce calcul inclut un large éventail de services, allant des prédictions sur toutes les familles de modèles Gemini aux instances de processeur, de GPU et de TPU Agent Platform, en passant par les SKU basés sur l'engagement, tels que le débit provisionné.
Cliquez pour en savoir plus sur les SKU inclus dans le calcul des dépenses.
Le tableau suivant répertorie les catégories de Google Cloud SKU incluses dans le calcul des dépenses totales.
| Catégorie | Description des SKU inclus |
|---|---|
| Modèles Gemini | Toutes les familles de modèles Gemini (par exemple, 2.0, 2.5, 3.0 dans les versions Pro, Flash et Lite) pour les prédictions dans toutes les modalités (texte, image, audio, vidéo), y compris les variantes par lot, de contexte long, réglées et "de réflexion" |
| Fonctionnalités des modèles Gemini | Tous les SKU Gemini associés pour des fonctionnalités telles que la mise en cache, le stockage de la mise en cache et les niveaux de priorité, dans toutes les modalités et versions de modèles |
| Processeur Agent Platform | Prédictions en ligne et par lot sur toutes les familles d'instances basées sur le processeur (par exemple, C2, C3, E2, N1, N2 et leurs variantes) |
| GPU Agent Platform | Prédictions en ligne et par lot sur toutes les instances accélérées par GPU NVIDIA (par exemple, A100, H100, H200, B200, L4, T4, V100 et la série RTX) |
| TPU Agent Platform | Prédictions en ligne et par lot sur toutes les instances basées sur TPU (par exemple, TPU-v5e, v6e) |
| Gestion et frais | Tous les SKU de "frais de gestion" associés à différentes instances de prédiction Agent Platform |
| Débit provisionné | Tous les SKU basés sur l'engagement pour le débit provisionné |
| Autres services | Services spécialisés tels que "Ancrage LLM pour Gemini... avec l'outil de recherche Google" |
Vérifier le niveau d'utilisation
Pour vérifier le niveau d'utilisation de votre organisation, accédez au
tableau de bord Agent Platform dans la Google Cloud console.
Pour afficher le niveau d'utilisation dans le tableau de bord, vous devez disposer du
rôle Lecteur Agent Platform
(roles/aiplatform.viewer) sur le projet et du
rôle Lecteur de compte de facturation
(roles/billing.viewer) sur le compte de facturation.
Accéder au tableau de bord Agent Platform
Vérifier les dépenses
Pour consulter vos dépenses Agent Platform, accédez à Cloud Billing dans la Google Cloud console. Notez que les dépenses sont agrégées au niveau de l'organisation.
Erreurs d'épuisement des ressources (429)
Si vous recevez une erreur 429, cela n'indique pas que vous avez atteint un quota fixe.
Cela indique une forte contention temporaire pour une ressource partagée spécifique. Nous vous recommandons d'implémenter une stratégie de nouvelle tentative avec intervalle exponentiel pour gérer ces erreurs, car la disponibilité dans cet environnement dynamique peut changer rapidement. En plus d'une stratégie de nouvelle tentative, nous vous recommandons d'utiliser le point de terminaison mondial. Contrairement à un point de terminaison régional (par exemple, us-central1), le point de terminaison mondial achemine dynamiquement vos requêtes vers la région disposant de la plus grande capacité disponible à ce moment-là. Cela permet à votre application d'accéder à un pool de capacité partagée multirégional plus important, ce qui augmente considérablement votre potentiel de pointe et réduit le risque d'erreurs 429.
Pour de meilleurs résultats, combinez l'utilisation du point de terminaison mondial avec le lissage du trafic. Évitez d'envoyer des requêtes en pics nets de second niveau, car un trafic élevé et instantané peut entraîner une limitation, même si votre utilisation moyenne par minute est inférieure à votre limite de débit de base. Une répartition plus uniforme de vos appels d'API aide le système à gérer votre charge de manière prévisible et améliore les performances globales. Pour en savoir plus sur la gestion des erreurs d'épuisement des ressources, consultez Créer des applications LLM résilientes et Réduire les erreurs 429 et le code d'erreur 429.
Modèles compatibles
Les modèles Gemini en disponibilité générale (DG) suivants et leurs modèles affinés supervisés sont compatibles avec l'option Standard PayGo avec niveaux d'utilisation :
Cliquez pour développer les modèles compatibles
Les modèles Gemini en GA suivants et leurs modèles affinés supervisés sont également compatibles avec l'option Standard PayGo, mais les niveaux d'utilisation ne s'appliquent pas à ces modèles :
Notez que ces niveaux ne s'appliquent pas aux modèles en preview. Pour obtenir les informations les plus précises et à jour, consultez la documentation officielle spécifique de chaque modèle.
Surveiller le débit et les performances
Pour surveiller la consommation de jetons en temps réel de votre organisation, accédez à l'explorateur de métriques dans Cloud Monitoring.
Accéder à l'explorateur de métriques
Pour en savoir plus sur la surveillance du trafic des points de terminaison des modèles, consultez Surveiller les modèles.
Notez que les niveaux d'utilisation s'appliquent au niveau de l'organisation. Pour savoir comment définir votre champ d'application d'observabilité afin de représenter graphiquement le débit sur plusieurs projets de votre organisation, consultez Configurer des champs d'application d'observabilité pour les requêtes multiprojets.
Étape suivante
Quotas et limites Agent Platform
Quotas et limites liés à Agent Platform, à l'exclusion des limites spécifiques aux produits.
Quotas Google Cloud
Découvrez comment Google Cloud limite la quantité d'une ressource que votre projet Google Cloud peut utiliser, et comment les quotas s'appliquent à différents types de ressources, y compris les composants matériels, logiciels et réseau.