Metriche di accesso

Questo documento descrive come accedere alle metriche generate dalla tua app Gemini Enterprise. Queste metriche forniscono informazioni sul rendimento e sull'integrità della tua applicazione.

Puoi visualizzare la telemetria delle metriche utilizzando Esplora metriche o direttamente all'interno dei singoli agenti utilizzando la scheda Osservabilità dell'agente.

Concetti fondamentali

Questa sezione introduce i concetti chiave relativi all'osservabilità in Gemini Enterprise.

Concetto Descrizione
Metriche Le metriche sono misurazioni numeriche che i sistemi raccolgono nel tempo. Queste misurazioni rappresentano il rendimento, l'utilizzo delle risorse o il comportamento di un sistema. Gli ingegneri utilizzano le metriche per monitorare l'integrità del sistema, identificare le tendenze e attivare gli avvisi.
Metriche con ambito dell'agente Metriche che misurano l'attività di un singolo agente, ad esempio le sue sessioni, le svolte conversazionali e le chiamate degli strumenti. Sono elencate sotto il tipo di risorsa Agente Gemini Enterprise e vengono raccolte solo quando l'impostazione di osservabilità Abilita l'instrumentazione di tracce e log OpenTelemetry è attivata per l'agente.
Metriche con ambito dell'app Metriche che misurano tutto il traffico verso un'app anziché verso un singolo agente, ad esempio il conteggio delle richieste e la latenza end-to-end. Sono elencate nel tipo di risorsa Motore Gemini Enterprise , dove Motore è il nome API di un'app Gemini Enterprise e vengono raccolte indipendentemente dalle impostazioni di osservabilità.

Prima di iniziare

Assicurati di avere quanto segue:

  • Il ruolo Amministratore Gemini Enterprise o il ruolo Utente Gemini Enterprise della Google Cloud console.

  • Un'app web Gemini Enterprise esistente. Per informazioni sulla creazione di una nuova app, vedi Creare un'app.

  • Per accedere a Metrics Explorer, devi disporre del ruolo Monitoring Viewer (roles/monitoring.viewer).

  • Abilita l'impostazione di osservabilità Abilita l'instrumentazione di tracce e log OpenTelemetry. A seconda del tipo di agente, abilita questa impostazione nelle configurazioni a livello di app (per l'agente Core Assistant ) o nella scheda Configurazione dell'agente (per gli agenti creati dai dipendenti di Workflow Builder e gli agenti Deep Research). Per saperne di più, consulta Gestire le impostazioni di osservabilità. Questa impostazione è obbligatoria per le metriche con ambito dell'agente. Le metriche con ambito dell'app, elencate nel tipo di risorsa Motore Gemini Enterprise, vengono raccolte senza questa impostazione.

Conservazione dei dati

Le metriche generate dalla tua app Gemini Enterprise vengono archiviate in Cloud Monitoring nel tuo Google Cloud progetto e la loro conservazione è regolata da Cloud Monitoring. Le metriche di Gemini Enterprise vengono pubblicate con il discoveryengine.googleapis.com/ prefisso, che rientra nel livello "tutte le altre Google Cloud metriche" e viene conservato per 6 settimane per impostazione predefinita. I dati precedenti al periodo di conservazione vengono eliminati automaticamente. Per i valori di conservazione autorevoli e più recenti, consulta Conservazione dei dati nella documentazione Quote e limiti di Cloud Monitoring.

Accedere alle metriche in Metrics Explorer

Per accedere alle metriche:

  1. Nella Google Cloud console, vai alla pagina Esplora metriche.

    Vai a Esplora metriche

  2. Seleziona il Google Cloud progetto in cui è stata creata l'app Gemini Enterprise.

  3. Fai clic su Seleziona una metrica per aprire una barra di ricerca.

  4. Nella barra di ricerca, cerca le seguenti metriche:

    Nome metrica Descrizione
    Agente Gemini Enterprise - Conteggio sessioni agente Gemini Enterprise Il numero di sessioni gestite dall'agente Gemini Enterprise.
    Agente Gemini Enterprise - Conteggio strumenti agente Gemini Enterprise Il numero di volte in cui gli strumenti sono stati chiamati dall'agente Gemini Enterprise.
    Agente Gemini Enterprise - Conteggio svolte agente Gemini Enterprise Il numero di svolte conversazionali all'interno delle sessioni dell'agente Gemini Enterprise.
    Agente Gemini Enterprise - Latenza totale agente Gemini Enterprise La latenza totale delle risposte dell'agente Gemini Enterprise.
    Agente Gemini Enterprise - Latenza totale strumenti agente Gemini Enterprise La latenza totale generata dalle esecuzioni degli strumenti all'interno del l'agente Gemini Enterprise.
    Connettore dati Gemini Enterprise - Connettore dati Gemini Enterprise Conteggio richieste Il conteggio totale delle richieste effettuate ai connettori dati Gemini Enterprise (chiamati anche datastore nella Google Cloud console).
    Connettore dati Gemini Enterprise - Connettore dati Gemini Enterprise Latenze richieste (Beta) La latenza in millisecondi delle richieste effettuate ai connettori dati Gemini Enterprise (chiamati anche datastore nella Google Cloud console).
    Motore Gemini Enterprise - Conteggio richieste motore Gemini Enterprise Il numero totale di richieste ricevute dalla tua app Gemini Enterprise, per tutto il traffico verso l'app anziché verso un singolo agente. Suddivise per metodo API, codice di risposta gRPC codice di risposta, classe di codice di risposta, tipo di query e modello.
    Motore Gemini Enterprise - Latenza totale richieste motore Gemini Enterprise La distribuzione della latenza delle richieste end-to-end per la tua app Gemini Enterprise. Registrata per ogni richiesta, incluse quelle che restituiscono un errore.
    Motore Gemini Enterprise - Latenza al primo token di risposta motore Gemini Enterprise La distribuzione della latenza tra la ricezione di una richiesta e lo streaming del primo token di risposta. Registrata solo per le richieste che producono almeno un token di risposta.
    Motore Gemini Enterprise - Latenza al primo token motore Gemini Enterprise La distribuzione della latenza tra la ricezione di una richiesta e lo streaming del primo token, sia che il token faccia parte del processo di pensiero del modello sia che sia una risposta finale. Registrata solo per richieste che producono almeno un token trasmesso.
  5. Seleziona la metrica che vuoi esplorare e fai clic su Applica.

  6. Facoltativamente, imposta filtri di etichette aggiuntivi, elementi di aggregazione e regola l'intervallo di tempo.

    Screenshot di Metrics Explorer nella console Google Cloud , che mostra le metriche dell'agente Gemini Enterprise.

Accedere alle metriche degli agenti

Puoi anche visualizzare le dashboard delle metriche operative, specifiche per gli strumenti e delle sessioni direttamente per i singoli agenti nella scheda Osservabilità dell'agente nella Google Cloud console.

Per accedere alle metriche di un agente:

  1. Nella Google Cloud console, vai all'app e fai clic su Agenti.
  2. Seleziona l'agente che vuoi esaminare e fai clic sulla scheda Osservabilità.

La scheda Osservabilità fornisce la telemetria operativa chiave suddivisa in quattro visualizzazioni: Panoramica, Strumenti, Latenza e Percentuale di errori.

Metriche della panoramica

Questa visualizzazione fornisce una dashboard che riepiloga i dati standard di sessione e di integrità dell'agente, tra cui:

  • Sessioni: conteggio totale delle sessioni utente.
  • Tempo medio per sessione: tempo medio trascorso durante una sessione.
  • Chiamate dell'agente: numero totale di volte in cui è stato chiamato l'agente.
  • Latenza dell'agente: latenza nel tempo e metriche specifiche.
  • Traffico dell'agente: volume delle richieste in entrata.
  • Percentuale di errori dell'agente: percentuale di chiamate dell'agente non riuscite.

Screenshot della visualizzazione Panoramica della scheda Osservabilità nella console Google Cloud , che mostra sessioni, turni medi per sessione, invocazioni dell'agente, latenza, traffico e tasso di errore

Metriche degli strumenti

Questa visualizzazione si concentra in modo specifico sull'utilizzo e sulla latenza degli strumenti connessi all'agente, tra cui:

  • Chiamate totali: numero di richieste di esecuzione degli strumenti.
  • Durata P95 per strumento: la latenza del 95° percentile delle esecuzioni, suddivisa per strumento.
  • Conteggio delle chiamate per strumento: conteggio totale delle chiamate suddiviso tra i diversi strumenti.
  • Percentuale di errori per strumento: la percentuale di errori delle esecuzioni per strumento.
  • Tariffa "Nessuno strumento chiamato": la frequenza con cui le interazioni non hanno attivato l'esecuzione di alcuno strumento.

Metriche di latenza

Questa visualizzazione mostra la latenza di risposta dell'agente. Ogni metrica viene mostrata come una scheda di riepilogo p50 e p95 per l'intervallo di tempo selezionato e come un grafico delle serie temporali che mostra le tendenze nel tempo. Puoi anche filtrare le metriche di latenza per funzionalità. La visualizzazione mostra le seguenti metriche:

  • Tempo al primo token (TTFT): la latenza tra la ricezione di una richiesta e lo streaming del primo token, sia che il token faccia parte del processo di pensiero del modello sia che sia una risposta.
  • Tempo alla prima risposta (TTFA): la latenza tra la ricezione di una richiesta e lo streaming del primo token di risposta, ovvero il primo token che non fa parte del pensiero del modello. Se l'agente chiama uno strumento dopo aver iniziato a rispondere, la misurazione viene riavviata, quindi TTFA riflette il momento in cui è iniziato lo streaming della risposta che l'utente legge, non la narrazione provvisoria.
  • Tempo all'ultimo token (TTLT): la latenza tra la ricezione di una richiesta e lo streaming dell'ultimo token, ovvero quando la risposta è completa.

Filtrare le metriche di latenza per funzionalità

Una funzionalità è il tipo di interazione che rappresenta una svolta, ad esempio una ricerca web o una generazione di immagini. Filtra le metriche di latenza per funzionalità per vedere quali tipi di interazione sono più lenti e per evitare che una funzionalità lenta distorca la latenza complessiva.

Per filtrare le metriche di latenza per funzionalità:

  1. Nella scheda Osservabilità dell'agente, fai clic sulla visualizzazione Latenza.
  2. Fai clic su Filtra per funzionalità.
  3. Seleziona la funzionalità che vuoi esaminare.

Le schede di riepilogo e i grafici delle serie temporali mostrano solo le svolte per quella funzionalità.

Per confrontare tutte le funzionalità contemporaneamente, utilizza la tabella Telemetria funzionalità , che elenca quanto segue per ogni funzionalità:

  • Quota di traffico: la percentuale di svolte attribuite alla funzionalità.
  • TTFT, TTFA e TTLT: la latenza p50 e p95 per la funzionalità.

Puoi filtrare utilizzando le seguenti funzionalità:

  • Parametrica: interazioni che inviano richieste al modello solo per l'output di testo, senza strumenti, ad esempio attività di traduzione.
  • Generazione di contenuti multimediali: attività di generazione di immagini e video.
  • Solo ricerca web: interazioni che inviano richieste al modello utilizzando lo strumento di ricerca web.
  • Analisi dei file caricati: interazioni che inviano richieste al modello insieme ai file caricati dall'utente.
  • Connettore: query che inviano richieste a connettori interni o di terze parti.
  • Canvas: attività di generazione che utilizzano Canvas.
  • Competenza: interazioni che chiamano una competenza.
  • Altro: una categoria generica per le svolte che riguardano più funzionalità o che non sono ancora state classificate.

Screenshot della visualizzazione Latenza della scheda Osservabilità nella console Google Cloud , che mostra il filtro delle funzionalità, le schede riepilogative p50 e p95, i grafici delle serie temporali per il tempo al primo token, il tempo alla prima risposta e il tempo all'ultimo token, nonché la tabella di telemetria delle funzionalità che elenca ogni funzionalità con la relativa quota di traffico e le latenze p50 e p95

Metriche della percentuale di errori

Questa visualizzazione mostra come vengono risolte le richieste dell'agente, raggruppate per classe di risposta: OK (2xx), Errori client (4xx), Errori server (5xx) e Annullate. Comprende:

  • Volume delle richieste per classe di risposta: conteggio delle richieste in entrata nel tempo, suddiviso per classe di risposta.
  • Percentuale di errori per classe di risposta: la percentuale di richieste non riuscite nel tempo, suddivisa per classe di risposta.
  • Codici di errore client (4xx) e Codici di errore server (5xx): i singoli codici di risposta gRPC canonici nel tempo, ad esempio INVALID_ARGUMENT o INTERNAL, in modo da poter capire quali errori specifici causano un picco.
  • Totali: il numero di richieste e la percentuale di richieste totali per ogni risultato nell'intervallo di tempo selezionato, con tabelle separate che classificano i singoli codici di errore client e server.

Screenshot della visualizzazione Tasso di errori della scheda Osservabilità nella console Google Cloud , che mostra il volume delle richieste e il tasso di errori per classe di risposta, i grafici delle serie temporali per i codici di errore client e server e le tabelle dei totali

Passaggi successivi