Auf dieser Seite wird beschrieben, wie Sie Agenten, die mit der Managed Agents API auf der Agent Platform erstellt wurden, mit dem Gen AI Evaluation Service bewerten. Sie können synthetische Testszenarien generieren, Ihren Agenten darauf anwenden und die resultierenden Unterhaltungsspuren mit vorgefertigten Messwerten bewerten.
Hinweis
Führen Sie die Schritte unter Agenten erstellen und verwalten aus, um eine verwaltete Agentenressource zu erstellen.
Installieren Sie das Agent Platform SDK mit der Erweiterung für die Bewertung:
pip install google-cloud-aiplatform[evaluation]Richten Sie die Authentifizierung ein und konfigurieren Sie Ihr Projekt:
Ersetzen Sie Folgendes:
- PROJECT_ID: Ihre Google Cloud Projekt-ID
import agentplatform client = agentplatform.Client( project="PROJECT_ID", location="global", )
Bewertungsablauf
Die Bewertung eines verwalteten Agenten umfasst drei Schritte:
- Szenarien generieren: Erstellen Sie automatisch verschiedene Mehrfachdialog-Testszenarien aus den Anweisungen und Tooldefinitionen des Agenten.
- Inferenz ausführen: Führen Sie den Agenten für die generierten Szenarien aus um Unterhaltungsspuren zu erfassen.
- Bewerten: Bewerten Sie die Unterhaltungsspuren mit vorgefertigten Messwerten.
Schritt 1: Unterhaltungsszenarien generieren
Verwenden Sie generate_conversation_scenarios, um automatisch Testszenarien basierend auf der Konfiguration Ihres Agenten zu erstellen. Die Methode liest die Systemanweisung und die Tools des Agenten, um realistische Nutzerprompts zu erstellen.
Ersetzen Sie Folgendes:
- PROJECT_ID: Ihre Google Cloud Projekt-ID
- AGENT_ID: Die ID Ihrer Agentenressource. Weitere Informationen zum Abrufen oder Auflisten benutzerdefinierter Agenten, um ihre IDs zu finden, finden Sie unter Agenten auflisten.
AGENT_RESOURCE = f"projects/PROJECT_ID/locations/global/agents/AGENT_ID"
scenarios = client.evals.generate_conversation_scenarios(
agent=AGENT_RESOURCE,
config={
"count": 5,
"generation_instruction": "Generate scenarios where a user asks for a refund.",
},
)
scenarios.show()
Jedes generierte Szenario enthält einen starting_prompt, der die erste Nutzernachricht in einer Unterhaltung darstellt.
Schritt 2: Inferenz ausführen
Verwenden Sie run_inference, um den Agenten für die generierten Szenarien auszuführen.
Der Agent führt jedes Szenario aus und erstellt eine Unterhaltungsspur, die die vollständige Interaktion erfasst, einschließlich Toolaufrufen, Zwischenschritten und der endgültigen Antwort.
inference_results = client.evals.run_inference(
agent=AGENT_RESOURCE,
src=scenarios,
config={"user_simulator_config": {"max_turn": 5}}
)
inference_results.show()
Schritt 3: Bewerten
Verwenden Sie evaluate, um die Unterhaltungsspuren mit vorgefertigten Messwerten zu bewerten.
Für die Bewertung von KI-Agenten sind die folgenden Messwerte verfügbar:
| Messwert | Beschreibung |
|---|---|
final_response_quality_v1 |
Bewertet, ob der Agent die Aufgabe des Nutzers erfolgreich abgeschlossen hat. |
safety_v1 |
Bewertet, ob die Antworten des Agenten sicher sind. |
multi_turn_task_success_v1 |
Bewertet, ob der Agent die Mehrfachdialog-Aufgabe des Nutzers erfolgreich abgeschlossen hat. |
from agentplatform import types
eval_result = client.evals.evaluate(
dataset=inference_results,
metrics=[
types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
],
agent=AGENT_RESOURCE,
)
eval_result.show()
Die Methode show() zeigt einen interaktiven Bericht mit aggregierten Ergebnissen, Begründungen für jeden Fall und den Unterhaltungsspuren des Agenten, einschließlich der Systemtopologie (Agententools und -anweisungen).
Vorhandene Interaktionen bewerten
Sie können auch Interaktionen bewerten, die bereits mit dem Agenten aufgezeichnet wurden. Dies ist nützlich, um die Qualität von Produktionsunterhaltungen zu bewerten. Informationen zum Senden einer Interaktion an einen Agenten und zum Abrufen der interaction_id finden Sie unter Interaktion an einen benutzerdefinierten Agenten senden.
Ersetzen Sie Folgendes:
- PROJECT_ID: Ihre Google Cloud Projekt-ID
- INTERACTION_ID: Die ID einer aufgezeichneten Interaktion.
- AGENT_RESOURCE: Der vollständige Ressourcenname Ihres Agenten im
Format
projects/PROJECT_ID/locations/global/agents/AGENT_ID.
interactions_dataset = types.EvaluationDataset(
eval_cases=[
types.EvalCase(
interactions_data_source=types.InteractionsDataSource(
interaction=f"projects/PROJECT_ID/locations/global/interactions/INTERACTION_ID",
gemini_agent_config=types.GeminiAgentConfig(
gemini_agent=AGENT_RESOURCE,
),
),
),
]
)
eval_result = client.evals.evaluate(
dataset=interactions_dataset,
metrics=[
types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
],
agent=AGENT_RESOURCE,
)
eval_result.show()
Nächste Schritte
Agenten erstellen und verwalten
Informationen zum Erstellen, Aktualisieren, Auflisten, Abrufen und Löschen von Agenten mit der REST API.
Mit Agenten interagieren
Informationen zur Interaktion mit Agenten zur Laufzeit, zum Verwalten des Sitzungsstatus und zum dynamischen Überschreiben von Konfigurationen.
Bewertung von KI-Agenten
Informationen zur Bewertung von KI-Agenten auf der Google Agent Platform.
Bewertungsmesswerte verwalten
Informationen zum Verwalten von Bewertungsmesswerten auf der Google Agent Platform.