Standard Pay-as-you-go (Standard PayGo) ist eine Verbrauchsoption für die Nutzung der Suite generativer KI-Modelle der Gemini Enterprise Agent Platform, einschließlich der Gemini-Modellfamilie.
Mit Standard PayGo zahlen Sie nur für die Ressourcen, die Sie verbrauchen, ohne dass finanzielle Vorabverpflichtungen erforderlich sind. Um eine besser vorhersagbare Leistung für skalierbare Arbeitslasten zu bieten, umfasst Standard PayGo ein System mit Nutzungsstufen. Die Agent Platform passt die grundlegende Durchsatzkapazität Ihrer Organisation dynamisch an, basierend auf den Gesamtausgaben für berechtigte Agent Platform-Dienste über einen Zeitraum von 30 Tagen. Mit steigenden Ausgaben Ihrer Organisation wird sie automatisch auf höhere Stufen hochgestuft, die einen besseren Zugriff auf freigegebene Ressourcen und höhere Leistungsschwellen bieten. Für Arbeitslasten, die eine konsistentere Leistung als Standard PayGo erfordern, sollten Sie Priority PayGo in Betracht ziehen. Informationen zu dedizierter und garantierter Kapazität, siehe Bereitgestellter Durchsatz.
Nutzungsstufen und Durchsatz
Jede Standard PayGo-Nutzungsstufe bietet einen grundlegenden Durchsatz, gemessen in Tokens pro Minute (TPM), der als vorhersehbarer Mindestwert für den Traffic Ihrer Organisation dient. Die Durchsatzlimits basieren auf Anfragen, die an den globalen Endpunkt gesendet werden. Die Verwendung des globalen Endpunkts ist eine Best Practice, da er Zugriff auf einen größeren, multiregionalen Pool von Durchsatzkapazität bietet und die Weiterleitung Ihrer Anfragen an den Standort mit der höchsten Verfügbarkeit ermöglicht, um die Leistung zu maximieren.
Ihr Traffic ist nicht streng auf das Limit für den grundlegenden Durchsatz begrenzt. Die Agent Platform lässt Traffic über dieses Limit hinaus zu, wobei die Leistung bestmöglich ist. In Zeiten hoher Nachfrage in der Agent Platform kann dieser zusätzliche Burst-Traffic jedoch eine höhere Leistungsvariabilität aufweisen. Um die Leistung zu optimieren und die Wahrscheinlichkeit zu minimieren, dass diese Fehler auftreten, ist es auch eine Best Practice, den Traffic so gleichmäßig wie möglich über jede Minute zu verteilen. Vermeiden Sie es, Anfragen in scharfen, sekundenschnellen Spitzen zu senden. Hoher und sofortiger Traffic kann zu einer Drosselung führen, auch wenn Ihre durchschnittliche Nutzung pro Minute unter dem Limit liegt. Wenn Sie Ihre API-Aufrufe gleichmäßiger verteilen, kann das System Ihre Last besser vorhersagen und die Gesamtleistung verbessern.
Die folgenden Stufen sind in Standard PayGo verfügbar:
| Modellfamilie | Stufe | Kundenausgaben (30 Tage) | Traffic-TPM (Organisationsebene) |
|---|---|---|---|
| Gemini Pro-Modelle | Stufe 1 | 10 $ bis 250 $ | 500.000 |
| Stufe 2 | 250 $ bis 2.000 $ | 1.000.000 | |
| Stufe 3 | Über 2.000 $ | 2.000.000 | |
| Gemini Flash- und Flash-Lite-Modelle | Stufe 1 | 10 $ bis 250 $ | 2.000.000 |
| Stufe 2 | 250 $ bis 2.000 $ | 4.000.000 | |
| Stufe 3 | Über 2.000 $ | 10.000.000 |
Das für eine Modellfamilie angegebene Durchsatzlimit gilt unabhängig für jedes Modell innerhalb dieser Familie. Ein Kunde auf Stufe 3 hat beispielsweise einen grundlegenden Durchsatz von 10.000.000 TPM für Gemini 2.5 Flash. Die Nutzung eines dieser Limits wirkt sich nicht auf den Durchsatz für andere Modelle aus. Für jede Stufe gibt es kein separates Limit für Anfragen pro Minute (RPM). Es gilt jedoch das Systemlimit von 30.000 RPM pro Modell und Region applies. Für Gemini-Anfragen mit multimodalen Eingaben gelten die entsprechenden Systemratenlimits, einschließlich Bild, Audio, Video und Dokument.
Funktionsweise von Nutzungsstufen
Ihre Nutzungsstufe wird automatisch durch die Gesamtausgaben Ihrer Organisation für berechtigte Agent Platform-Dienste über einen Zeitraum von 30 Tagen bestimmt. Mit steigenden Ausgaben Ihrer Organisation stuft das System Sie auf eine höhere Stufe mit höherem Durchsatz hoch.
Ausgabenberechnung
Diese Berechnung umfasst eine Vielzahl von Diensten, von Vorhersagen für alle Gemini-Modellfamilien bis hin zu Agent Platform-CPU-, GPU- und TPU-Instanzen sowie zusicherungsbasierten SKUs wie Bereitgestellter Durchsatz.
Klicken Sie hier, um mehr über die in der Ausgabenberechnung enthaltenen SKUs zu erfahren.
In der folgenden Tabelle sind die Kategorien von Google Cloud SKUs aufgeführt, die in die Berechnung der Gesamtausgaben einfließen.
| Kategorie | Beschreibung der enthaltenen SKUs |
|---|---|
| Gemini-Modelle | Alle Gemini-Modellfamilien (z.B. 2.0, 2.5, 3.0 in den Versionen Pro, Flash und Lite) für Vorhersagen in allen Modalitäten (Text, Bild, Audio, Video), einschließlich Batch-, Langkontext-, abgestimmter und „Denk“-Variationen |
| Gemini-Modellfunktionen | Alle zugehörigen Gemini-SKUs für Funktionen wie Caching, Caching-Speicher und Prioritätsstufen in allen Modalitäten und Modellversionen |
| Agent Platform-CPU | Online- und Batchvorhersagen für alle CPU-basierten Instanzfamilien (z.B. C2, C3, E2, N1, N2 und ihre Varianten) |
| Agent Platform-GPU | Online- und Batchvorhersagen für alle NVIDIA-GPU-beschleunigten Instanzen (z.B. A100, H100, H200, B200, L4, T4, V100 und RTX-Serie) |
| Agent Platform-TPU | Online- und Batchvorhersagen für alle TPU-basierten Instanzen (z.B. TPU-v5e, v6e) |
| Verwaltung und Gebühren | Alle SKUs für die Verwaltungsgebühr, die verschiedenen Agent Platform-Vorhersageinstanzen zugeordnet sind |
| Bereitgestellter Durchsatz | Alle zusicherungsbasierten SKUs für bereitgestellten Durchsatz |
| Weitere Dienste | Spezialisierte Dienste wie „LLM Grounding for Gemini... with Google Search tool“ |
Nutzungsstufe prüfen
Rufen Sie in der Google Cloud Console das
Agent Platform-Dashboard auf, um die Nutzungsstufe für Ihre Organisation zu prüfen.
Um die Nutzungsstufe im Dashboard zu sehen, benötigen Sie die
Rolle „Agent Platform-Betrachter“
(roles/aiplatform.viewer) für das Projekt und die
Rolle „Rechnungskontobetrachter“
(roles/billing.viewer) für das Rechnungskonto.
Ausgaben prüfen
Rufen Sie in der Google Cloud Console Cloud Billing auf, um Ihre Agent Platform-Ausgaben zu prüfen. Die Ausgaben werden auf Organisationsebene zusammengefasst.
Fehler vom Typ „Ressource erschöpft“ (429)
Wenn Sie einen 429-Fehler erhalten, bedeutet das nicht, dass Sie ein festes Kontingent erreicht haben.
Es weist auf eine vorübergehend hohe Auslastung einer bestimmten freigegebenen Ressource hin. Wir empfehlen, eine exponentielle Backoff-Wiederholungsstrategie zu implementieren, um diese Fehler zu beheben, da sich die Verfügbarkeit in dieser dynamischen Umgebung schnell ändern kann. Zusätzlich zu einer Wiederholungsstrategie empfehlen wir die Verwendung des globalen Endpunkts. Im Gegensatz zu einem regionalen Endpunkt (z. B. „us-central1“) leitet der globale Endpunkt Ihre Anfragen dynamisch an die Region mit der zu diesem Zeitpunkt höchsten verfügbaren Kapazität weiter. So kann Ihre Anwendung auf einen größeren, multiregionalen Pool mit freigegebener Kapazität zugreifen, wodurch sich die Wahrscheinlichkeit für erfolgreiche Burst-Vorgänge deutlich erhöht und die Wahrscheinlichkeit für 429-Fehler sinkt.
Die besten Ergebnisse erzielen Sie, wenn Sie den globalen Endpunkt mit der Traffic-Glättung kombinieren. Vermeiden Sie es, Anfragen in scharfen, sekundenschnellen Spitzen zu senden, da hoher und sofortiger Traffic zu einer Drosselung führen kann, auch wenn Ihre durchschnittliche Nutzung pro Minute innerhalb des Limits für den grundlegenden Durchsatz liegt. Wenn Sie Ihre API-Aufrufe gleichmäßiger verteilen, kann das System Ihre Last besser vorhersagen und die Gesamtleistung verbessern. Weitere Informationen zum Beheben von Fehlern vom Typ „Ressource erschöpft“ finden Sie unter Resiliente LLM-Anwendungen entwickeln und 429-Fehler reduzieren und Fehlercode 429.
Unterstützte Modelle
Die folgenden allgemein verfügbaren (GA) Gemini-Modelle und ihre überwacht feinabgestimmten Modelle unterstützen Standard PayGo mit Nutzungsstufen:
Klicken Sie hier, um die unterstützten Modelle zu maximieren.
Die folgenden GA Gemini-Modelle und ihre überwacht feinabgestimmten Modelle unterstützen ebenfalls Standard PayGo, aber die Nutzungsstufen gelten nicht für diese Modelle:
Diese Stufen gelten nicht für Vorschaumodelle. Die genauesten und aktuellsten Informationen finden Sie in der offiziellen Dokumentation des jeweiligen Modells.
Durchsatz und Leistung überwachen
Rufen Sie in Cloud Monitoring den Metrics Explorer auf, um den Tokenverbrauch Ihrer Organisation in Echtzeit zu überwachen.
Weitere Informationen zum Überwachen des Traffics von Modellendpunkten finden Sie unter Modelle überwachen.
Nutzungsstufen gelten auf Organisationsebene. Informationen zum Festlegen des Bereichs für die Beobachtbarkeit, um den Durchsatz für mehrere Projekte in Ihrer Organisation zu erfassen, finden Sie unter Bereiche für die Beobachtbarkeit für Abfragen für mehrere Projekte konfigurieren.
Nächste Schritte
Kontingente und Limits für die Agent Platform
Kontingente und Limits für die Agent Platform, mit Ausnahme produktspezifischer Einschränkungen.
Google Cloud-Kontingente
Informationen dazu, wie Google Cloud die Nutzung einer Ressource durch Ihr Google Cloud-Projekt einschränkt und wie Kontingente für eine Reihe von Ressourcentypen gelten, einschließlich Hardware-, Software- und Netzwerkkomponenten.