Questo documento descrive come utilizzare AI AutoMetrics per monitorare i carichi di lavoro AI su Gemini Enterprise Agent Platform.
AI AutoMetrics consente di monitorare le prestazioni e l'integrità dei modelli con una configurazione minima. Questa funzionalità è progettata per fornire informazioni immediate sui container e sui modelli personalizzati in esecuzione su Vertex AI Inference.
Prima di iniziare
- Assicurati di avere un endpoint Gemini Enterprise Agent Platform con un modello di cui è stato eseguito il deployment che utilizza un container con framework supportati.
- Assicurati che il progetto abbia abilitato Cloud Monitoring. Per ulteriori informazioni, vedi Abilitare l'API Monitoring.
Utilizzare AI AutoMetrics
Per visualizzare AI AutoMetrics in Metrics Explorer:
Vai alla pagina Esplora metriche nella Google Cloud console.
In Seleziona una metrica, seleziona Target Prometheus.
In Categorie di metriche attive, seleziona Vertex.
In Metriche attive, seleziona la metrica desiderata.
Fai clic su Applica.
Puoi anche eseguire query sulle metriche utilizzando Grafana, o l'API o l'interfaccia utente di Prometheus.
Framework supportati
AI AutoMetrics supporta i seguenti framework:
| Framework | Endpoint qualificato | Metriche qualificate |
|---|---|---|
| vLLM | Endpoint /metrics compatibile con Prometheus |
Metriche con prefisso vllm: |
Come funziona
Gemini Enterprise Agent Platform esegue automaticamente lo scraping dell'endpoint /metrics del container a un intervallo predefinito. Tutte le metriche qualificate vengono quindi esportate in
Google Cloud Google Cloud Managed Service per Prometheus,
dove puoi analizzarle e visualizzarle.
Nomi ed etichette delle metriche
Le metriche raccolte da AI AutoMetrics vengono inserite in Cloud Monitoring con la convenzione di denominazione vertex_*.
Per semplificare il filtraggio e il raggruppamento, AI AutoMetrics associa automaticamente le seguenti etichette aggiuntive di Gemini Enterprise Agent Platform a ogni metrica:
deployed_model_id: l'ID di un modello di cui è stato eseguito il deployment che gestisce le richieste di inferenza.model_display_name: il nome visualizzato di un modello di cui è stato eseguito il deployment.replica_id: l'ID univoco corrispondente alla replica del modello di cui è stato eseguito il deployment (nome del pod).endpoint_id: l'ID di un endpoint del modello.endpoint_display_name: il nome visualizzato di un endpoint del modello.product: il nome della funzionalità in Gemini Enterprise Agent Platform. È sempre Inferenza online.
Passaggi successivi
- Scopri di più su Esplora metriche.