Monitorare i modelli

Questo documento spiega come monitorare il comportamento, lo stato e il rendimento dei modelli completamente gestiti in Gemini Enterprise Agent Platform. Descrive come utilizzare la dashboard di osservabilità dei modelli predefinita per ottenere insight sull'utilizzo dei modelli, identificare i problemi di latenza e risolvere gli errori.

Scopri come:

  • Accedere alla dashboard di osservabilità dei modelli e interpretarla.
  • Visualizzare le metriche di monitoraggio disponibili.
  • Monitorare il traffico dell'endpoint del modello utilizzando Metrics Explorer.

Accedere alla dashboard di osservabilità dei modelli e interpretarla

Agent Platform fornisce una dashboard di osservabilità dei modelli predefinita per visualizzare il comportamento, lo stato e il rendimento dei modelli completamente gestiti. I modelli completamente gestiti, noti anche come Model as a Service (MaaS), sono forniti da Google e includono i modelli Gemini di Google e i modelli dei partner con endpoint gestiti. Le metriche dei modelli self-hosted non sono incluse nella dashboard.

Agent Platform raccoglie e segnala automaticamente l'attività dei modelli MaaS per aiutarti a risolvere rapidamente i problemi di latenza e monitorare la capacità.

Una dashboard di osservabilità del modello di esempio in Cloud Console
Esempio di dashboard di osservabilità dei modelli

Caso d'uso

In qualità di sviluppatore di applicazioni, puoi visualizzare il modo in cui gli utenti interagiscono con i modelli che hai esposto. Ad esempio, puoi visualizzare l'andamento dell'utilizzo dei modelli (richieste di modelli al secondo) e l'intensità di calcolo dei prompt degli utenti (latenze di chiamata dei modelli) nel tempo. Di conseguenza, poiché queste metriche sono correlate all'utilizzo dei modelli, puoi anche stimare i costi di esecuzione di ogni modello.

In caso di problemi, puoi risolverli rapidamente dalla dashboard. Puoi verificare se i modelli rispondono in modo affidabile e tempestivo visualizzando i tassi di errore dell'API, le latenze del primo token e la velocità effettiva dei token.

Metriche di monitoraggio disponibili

La dashboard di osservabilità dei modelli mostra un sottoinsieme di metriche raccolte da Cloud Monitoring, come la richiesta di modelli al secondo (QPS), la velocità effettiva dei token e le latenze del primo token. Visualizza la dashboard per vedere tutte le metriche disponibili.

Limitazioni

Agent Platform acquisisce le metriche della dashboard solo per le chiamate API all'endpoint di un modello. Google Cloud L'utilizzo della console, ad esempio le metriche di Agent Studio, non viene aggiunto alla dashboard.

Visualizzare la dashboard

  1. Nella sezione Agent Platform della Google Cloud console, vai alla Dashboard pagina.

Vai ad Agent Platform 1. Nella dashboard, in Osservabilità dei modelli, fai clic su Mostra tutte le metriche per visualizzare la dashboard di osservabilità dei modelli nella console Google Cloud Observability.

  1. Per visualizzare le metriche di un modello specifico o in una località specifica, imposta uno o più filtri nella parte superiore della pagina della dashboard.

    Per le descrizioni di ogni metrica, consulta la sezione "aiplatform" nella Google Cloud pagina delle metriche.

Monitorare il traffico dell'endpoint del modello

Segui queste istruzioni per monitorare il traffico verso l'endpoint in Metrics Explorer.

  1. Nella Google Cloud console, vai alla pagina Esplora metriche.

    Vai a Esplora metriche

  2. Seleziona il progetto di cui vuoi visualizzare le metriche.

  3. Dal menu a discesa Metrica, fai clic su Seleziona una metrica.

  4. Nella barra di ricerca Filtra in base al nome della risorsa o della metrica, inserisci Gemini Enterprise Agent Platform Endpoint.

  5. Seleziona la categoria di metriche Endpoint di Agent Platform > Previsione. In Metriche attive, seleziona una delle seguenti metriche:

    • prediction/online/error_count
    • prediction/online/prediction_count
    • prediction/online/prediction_latencies
    • prediction/online/response_count

    Fai clic su Applica. Per aggiungere più di una metrica, fai clic su Aggiungi query.

    Puoi filtrare o aggregare le metriche utilizzando i seguenti menu a discesa:

    • Per selezionare e visualizzare un sottoinsieme dei dati in base a criteri specificati, utilizza il menu a discesa Filtro. Ad esempio, per filtrare il modello gemini-2.0-flash-001, utilizza endpoint_id = gemini-2p0-flash-001 (tieni presente che il . nella versione del modello viene sostituito con una p).

    • Per combinare più punti dati in un unico valore e visualizzare una visualizzazione riepilogativa delle metriche, utilizza il menu a discesa Aggregazione. Ad esempio, puoi aggregare la somma di response_code.

  6. (Facoltativo) Puoi configurare gli avvisi per l'endpoint. Per ulteriori informazioni, consulta Gestire le policy di avviso.

Per visualizzare le metriche che aggiungi al progetto utilizzando una dashboard, consulta Panoramica delle dashboard.

Passaggi successivi