Questo documento spiega come monitorare il comportamento, lo stato e il rendimento dei modelli completamente gestiti in Gemini Enterprise Agent Platform. Descrive come utilizzare la dashboard di osservabilità dei modelli predefinita per ottenere insight sull'utilizzo dei modelli, identificare i problemi di latenza e risolvere gli errori.
Scopri come:
- Accedere alla dashboard di osservabilità dei modelli e interpretarla.
- Visualizzare le metriche di monitoraggio disponibili.
- Monitorare il traffico dell'endpoint del modello utilizzando Metrics Explorer.
Accedere alla dashboard di osservabilità dei modelli e interpretarla
Agent Platform fornisce una dashboard di osservabilità dei modelli predefinita per visualizzare il comportamento, lo stato e il rendimento dei modelli completamente gestiti. I modelli completamente gestiti, noti anche come Model as a Service (MaaS), sono forniti da Google e includono i modelli Gemini di Google e i modelli dei partner con endpoint gestiti. Le metriche dei modelli self-hosted non sono incluse nella dashboard.
Agent Platform raccoglie e segnala automaticamente l'attività dei modelli MaaS per aiutarti a risolvere rapidamente i problemi di latenza e monitorare la capacità.
Caso d'uso
In qualità di sviluppatore di applicazioni, puoi visualizzare il modo in cui gli utenti interagiscono con i modelli che hai esposto. Ad esempio, puoi visualizzare l'andamento dell'utilizzo dei modelli (richieste di modelli al secondo) e l'intensità di calcolo dei prompt degli utenti (latenze di chiamata dei modelli) nel tempo. Di conseguenza, poiché queste metriche sono correlate all'utilizzo dei modelli, puoi anche stimare i costi di esecuzione di ogni modello.
In caso di problemi, puoi risolverli rapidamente dalla dashboard. Puoi verificare se i modelli rispondono in modo affidabile e tempestivo visualizzando i tassi di errore dell'API, le latenze del primo token e la velocità effettiva dei token.
Metriche di monitoraggio disponibili
La dashboard di osservabilità dei modelli mostra un sottoinsieme di metriche raccolte da Cloud Monitoring, come la richiesta di modelli al secondo (QPS), la velocità effettiva dei token e le latenze del primo token. Visualizza la dashboard per vedere tutte le metriche disponibili.
Limitazioni
Agent Platform acquisisce le metriche della dashboard solo per le chiamate API all'endpoint di un modello. Google Cloud L'utilizzo della console, ad esempio le metriche di Agent Studio, non viene aggiunto alla dashboard.
Visualizzare la dashboard
- Nella sezione Agent Platform della Google Cloud console, vai alla Dashboard pagina.
Vai ad Agent Platform 1. Nella dashboard, in Osservabilità dei modelli, fai clic su Mostra tutte le metriche per visualizzare la dashboard di osservabilità dei modelli nella console Google Cloud Observability.
Per visualizzare le metriche di un modello specifico o in una località specifica, imposta uno o più filtri nella parte superiore della pagina della dashboard.
Per le descrizioni di ogni metrica, consulta la sezione "
aiplatform" nella Google Cloud pagina delle metriche.
Monitorare il traffico dell'endpoint del modello
Segui queste istruzioni per monitorare il traffico verso l'endpoint in Metrics Explorer.
Nella Google Cloud console, vai alla pagina Esplora metriche.
Seleziona il progetto di cui vuoi visualizzare le metriche.
Dal menu a discesa Metrica, fai clic su Seleziona una metrica.
Nella barra di ricerca Filtra in base al nome della risorsa o della metrica, inserisci
Gemini Enterprise Agent Platform Endpoint.Seleziona la categoria di metriche Endpoint di Agent Platform > Previsione. In Metriche attive, seleziona una delle seguenti metriche:
prediction/online/error_countprediction/online/prediction_countprediction/online/prediction_latenciesprediction/online/response_count
Fai clic su Applica. Per aggiungere più di una metrica, fai clic su Aggiungi query.
Puoi filtrare o aggregare le metriche utilizzando i seguenti menu a discesa:
Per selezionare e visualizzare un sottoinsieme dei dati in base a criteri specificati, utilizza il menu a discesa Filtro. Ad esempio, per filtrare il modello
gemini-2.0-flash-001, utilizzaendpoint_id = gemini-2p0-flash-001(tieni presente che il.nella versione del modello viene sostituito con unap).Per combinare più punti dati in un unico valore e visualizzare una visualizzazione riepilogativa delle metriche, utilizza il menu a discesa Aggregazione. Ad esempio, puoi aggregare la somma di
response_code.
(Facoltativo) Puoi configurare gli avvisi per l'endpoint. Per ulteriori informazioni, consulta Gestire le policy di avviso.
Per visualizzare le metriche che aggiungi al progetto utilizzando una dashboard, consulta Panoramica delle dashboard.
Passaggi successivi
- Per scoprire come creare avvisi per la dashboard, consulta Panoramica degli avvisi.
- Per scoprire di più sulla conservazione dei dati delle metriche, consulta le Quote e limiti di Monitoring.
- Per scoprire di più sui dati a riposo, consulta Proteggere i dati a riposo.
- Per visualizzare un elenco di tutte le metriche raccolte da Cloud Monitoring, consulta la sezione
"
aiplatform" nella pagina delle Google Cloud metriche.