Se il numero di richieste supera la capacità allocata per l'elaborazione delle richieste, viene restituito il codice di errore 429. La tabella seguente mostra il messaggio di errore generato da ogni tipo di framework di quota:
| Framework di quota | Messaggio |
|---|---|
| Pay-as-you-go | Resource exhausted, please try again later. |
| Throughput riservato | Too many requests. Exceeded the Provisioned Throughput. |
Con un abbonamento al Throughput riservato, puoi riservare una quantità di throughput per modelli di AI generativa specifici. Se non hai un abbonamento al Throughput riservato e le risorse non sono disponibili per la tua applicazione, viene restituito un codice di errore 429. Anche se non hai capacità riservata, puoi riprovare a inviare la richiesta. Tuttavia, la richiesta
non viene conteggiata ai fini della percentuale di errori, come descritto nell'accordo sul livello del servizio (SLA).
Per i progetti che hanno acquistato il Throughput riservato, Gemini Enterprise Agent Platform misura il throughput di un progetto e riserva la quantità di throughput acquistata per l'utilizzo effettivo del progetto.
Per il Throughput riservato standard, quando utilizzi una quantità inferiore a quella acquistata, gli errori che altrimenti potrebbero essere 429 vengono restituiti come 5XX e vengono conteggiati ai fini della percentuale di errori dello SLA. Per il Throughput riservato a zona singola, quando utilizzi una quantità inferiore a quella acquistata, gli errori 429 relativi alla capacità vengono trattati come 5XX, ma non vengono conteggiati ai fini della percentuale di errori dello SLA. Quando superi la quantità acquistata, le richieste aggiuntive vengono elaborate on demand con pagamento a consumo.
Pay-as-you-go
Nel framework di quota con pagamento a consumo, hai le seguenti opzioni per risolvere gli errori 429:
- Quando possibile, utilizza l'endpoint globale anziché un endpoint regionale.
- Implementa una strategia di nuovi tentativi utilizzando il backoff esponenziale troncato.
- Se il tuo modello utilizza le quote, puoi inviare una richiesta di aumento della quota (QIR). Se il tuo modello utilizza il pagamento a consumo standard, uniformare il traffico e ridurre i picchi elevati può essere utile.
- Potresti riscontrare errori
429a causa dei limiti di accelerazione se il tuo progetto registra un forte aumento dell'utilizzo. Per evitare di raggiungere i limiti di accelerazione, aumenta gradualmente il traffico e mantieni pattern di utilizzo coerenti. - Abbonati al Throughput riservato per un livello di servizio più coerente. Per ulteriori informazioni, consulta Throughput riservato.
Throughput riservato
Per correggere l'errore 429 generato dal Throughput riservato:
- Utilizza l'esempio di comportamento predefinito, che non imposta un'intestazione nelle richieste di previsione. Eventuali eccedenze vengono elaborate on demand e fatturate con pagamento a consumo.
- Aumenta il numero di GSU nell'abbonamento al Throughput riservato.
Passaggi successivi
- Per scoprire di più sul pagamento a consumo standard, consulta Pagamento a consumo standard.
- Per scoprire di più sul Throughput riservato, consulta Throughput riservato.
- Per scoprire di più su quote e limiti per l'AI generativa su Agent Platform, consulta Quote e limiti di sistema.
- Per scoprire di più su Google Cloud quote e limiti di sistema, consulta la documentazione sulle quote di Cloud.