Bewertungstypen
| Bewertungstyp | Anwendungsfall | Häufigkeit |
|---|---|---|
| Schnelle Bewertung | Testen neuer Agentenlogik oder Modelländerungen. | Häufig (Entwicklung) |
| Testfallbewertung | Regressionstests für ein bestimmtes Dataset. | Geplant (CI/CD) |
| Online-Monitoring | Qualität einer Agentenbereitstellung in der Produktion verfolgen. | Kontinuierlich (Produktion) |
Bewertungs-Workflow
Sie können Ihre Agenten über die Google Cloud Console oder das Agent Platform SDK bewerten.
Google Cloud Console
So führen Sie eine grundlegende Bewertung für eine Agentenbereitstellung aus:
- Rufen Sie in der Google Cloud Console die Seite Agent Platform > KI-Agenten auf.
- Wählen Sie im linken Navigationsmenü Bereitstellungen und dann Ihren Agenten aus.
- Wählen Sie den Tab Dashboard und dann den Unterbereich Bewertung aus.
- Klicken Sie auf Neue Bewertung.
- Folgen Sie der Anleitung, um Ihre Testfälle zu definieren und Messwerte auszuwählen.
- Klicken Sie auf Bewertung ausführen.
Ausführlichere Anleitungen finden Sie unter Offlinebewertungen ausführen oder Kontinuierliche Evaluierung mit Online-Monitoren.
Agent Platform SDK
Der Workflow zur Verbesserung von Agenten basiert auf dem Quality Flywheel, einem kontinuierlichen Zyklus aus Bewertung, Analyse und Optimierung. Sie bewerten die Leistung Ihres Agenten, analysieren die Ergebnisse, um Fehlercluster zu identifizieren, und optimieren dann Ihre Prompts oder Konfiguration, um diese Probleme zu beheben. Dieser iterative Prozess hilft Ihnen, Leistungslücken proaktiv zu erkennen und zu beheben.
Hinweis
Installieren Sie das Agent Platform SDK mit den erforderlichen Erweiterungen:
pip install google-cloud-aiplatform[adk,evaluation]
Initialisieren Sie den Agent Platform SDK -Client:
import vertexai from vertexai import Client client = Client(project="YOUR_PROJECT_ID", location="YOUR_LOCATION")
Wobei:
YOUR_PROJECT_ID: Projekt-ID in Google Cloud .YOUR_LOCATION: Ihre Cloud-Region, z. B.us-central1.
1. Bewertungsfälle definieren (Nutzersimulation)
Anstatt Testfälle manuell zu erstellen, können Sie mit der Nutzersimulation synthetische Unterhaltungspläne mit mehreren Zügen basierend auf den Anweisungen Ihres Agenten generieren.
# Generate scenarios from agent info eval_dataset = client.evals.generate_conversation_scenarios( agent_info=my_agent_info, config={ "count": 5, "generation_instruction": "Generate scenarios where a user asks for a refund.", }, )
Weitere Informationen finden Sie in der Referenz zum Agent Platform SDK.
2. Inferenzen ausführen
Führen Sie die Bewertungsfälle für Ihren Agenten aus, um Traces zu erfassen.
# Generate behavior traces using a multi-turn user simulator traces = client.evals.run_inference( agent=my_agent, src=eval_dataset, config={"user_simulator_config": {"max_turn": 5}} )
3. Messwerte berechnen (AutoRater)
Verwenden Sie AutoRater für mehrere Züge , um die erfassten Traces zu bewerten. Diese Rater analysieren den vollständigen Unterhaltungsverlauf, um die Einhaltung der Anweisungen und die Toolnutzung zu überprüfen.
# Evaluate the traces using multi-turn metrics eval_result = client.evals.evaluate( traces=traces, metrics=[ "MULTI_TURN_TASK_SUCCESS", "MULTI_TURN_TOOL_USE_QUALITY" ] )
4. Analyse durchführen (Fehlercluster)
Das System gruppiert fehlgeschlagene Bewertungen automatisch in Fehlercluster , um wichtige Agentenprobleme zu identifizieren.
# Identify the top failure patterns in the results loss_clusters = client.evals.generate_loss_clusters(eval_result=eval_result)
5. Agent optimieren
Verwenden Sie schließlich den Dienst Optimizer, um die Systemanweisungen oder Toolbeschreibungen Ihres Agenten programmatisch anhand der Fehlerdaten zu optimieren.
# Automatically refine the system prompt to fix identified issues optimize_result = client.optimizer.optimize( targets=["system_prompt"], benchmark=eval_result, tests=eval_dataset )
Nächste Schritte
- Offlinebewertungen ausführen
- Bewertungsergebnisse ansehen
- Weitere Informationen zum Gen AI Evaluation Service