Verwaltete KI-Agenten, die mit der Managed Agents API auf der Agent Platform erstellt wurden, bewerten

Auf dieser Seite wird beschrieben, wie Sie Agenten, die mit der Managed Agents API auf der Agent Platform erstellt wurden, mit dem Gen AI Evaluation Service bewerten. Sie können synthetische Testszenarien generieren, Ihren Agenten darauf anwenden und die resultierenden Unterhaltungsspuren mit vorgefertigten Messwerten bewerten.

Hinweis

  1. Führen Sie die Schritte unter Agenten erstellen und verwalten aus, um eine verwaltete Agentenressource zu erstellen.

  2. Installieren Sie das Agent Platform SDK mit der Erweiterung für die Bewertung:

    pip install google-cloud-aiplatform[evaluation]
    
  3. Richten Sie die Authentifizierung ein und konfigurieren Sie Ihr Projekt:

    Ersetzen Sie Folgendes:

    • PROJECT_ID: Ihre Google Cloud Projekt-ID
    import agentplatform
    
    client = agentplatform.Client(
        project="PROJECT_ID",
        location="global",
    )
    

Bewertungsablauf

Die Bewertung eines verwalteten Agenten umfasst drei Schritte:

  1. Szenarien generieren: Erstellen Sie automatisch verschiedene Mehrfachdialog-Testszenarien aus den Anweisungen und Tooldefinitionen des Agenten.
  2. Inferenz ausführen: Führen Sie den Agenten für die generierten Szenarien aus um Unterhaltungsspuren zu erfassen.
  3. Bewerten: Bewerten Sie die Unterhaltungsspuren mit vorgefertigten Messwerten.

Schritt 1: Unterhaltungsszenarien generieren

Verwenden Sie generate_conversation_scenarios, um automatisch Testszenarien basierend auf der Konfiguration Ihres Agenten zu erstellen. Die Methode liest die Systemanweisung und die Tools des Agenten, um realistische Nutzerprompts zu erstellen.

Ersetzen Sie Folgendes:

  • PROJECT_ID: Ihre Google Cloud Projekt-ID
  • AGENT_ID: Die ID Ihrer Agentenressource. Weitere Informationen zum Abrufen oder Auflisten benutzerdefinierter Agenten, um ihre IDs zu finden, finden Sie unter Agenten auflisten.
AGENT_RESOURCE = f"projects/PROJECT_ID/locations/global/agents/AGENT_ID"

scenarios = client.evals.generate_conversation_scenarios(
    agent=AGENT_RESOURCE,
    config={
        "count": 5,
        "generation_instruction": "Generate scenarios where a user asks for a refund.",
    },
)

scenarios.show()

Jedes generierte Szenario enthält einen starting_prompt, der die erste Nutzernachricht in einer Unterhaltung darstellt.

Schritt 2: Inferenz ausführen

Verwenden Sie run_inference, um den Agenten für die generierten Szenarien auszuführen. Der Agent führt jedes Szenario aus und erstellt eine Unterhaltungsspur, die die vollständige Interaktion erfasst, einschließlich Toolaufrufen, Zwischenschritten und der endgültigen Antwort.

inference_results = client.evals.run_inference(
    agent=AGENT_RESOURCE,
    src=scenarios,
    config={"user_simulator_config": {"max_turn": 5}}
)

inference_results.show()

Schritt 3: Bewerten

Verwenden Sie evaluate, um die Unterhaltungsspuren mit vorgefertigten Messwerten zu bewerten. Für die Bewertung von KI-Agenten sind die folgenden Messwerte verfügbar:

Messwert Beschreibung
final_response_quality_v1 Bewertet, ob der Agent die Aufgabe des Nutzers erfolgreich abgeschlossen hat.
safety_v1 Bewertet, ob die Antworten des Agenten sicher sind.
multi_turn_task_success_v1 Bewertet, ob der Agent die Mehrfachdialog-Aufgabe des Nutzers erfolgreich abgeschlossen hat.
from agentplatform import types

eval_result = client.evals.evaluate(
    dataset=inference_results,
    metrics=[
        types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
    ],
    agent=AGENT_RESOURCE,
)

eval_result.show()

Die Methode show() zeigt einen interaktiven Bericht mit aggregierten Ergebnissen, Begründungen für jeden Fall und den Unterhaltungsspuren des Agenten, einschließlich der Systemtopologie (Agententools und -anweisungen).

Vorhandene Interaktionen bewerten

Sie können auch Interaktionen bewerten, die bereits mit dem Agenten aufgezeichnet wurden. Dies ist nützlich, um die Qualität von Produktionsunterhaltungen zu bewerten. Informationen zum Senden einer Interaktion an einen Agenten und zum Abrufen der interaction_id finden Sie unter Interaktion an einen benutzerdefinierten Agenten senden.

Ersetzen Sie Folgendes:

  • PROJECT_ID: Ihre Google Cloud Projekt-ID
  • INTERACTION_ID: Die ID einer aufgezeichneten Interaktion.
  • AGENT_RESOURCE: Der vollständige Ressourcenname Ihres Agenten im Format projects/PROJECT_ID/locations/global/agents/AGENT_ID.
interactions_dataset = types.EvaluationDataset(
    eval_cases=[
        types.EvalCase(
            interactions_data_source=types.InteractionsDataSource(
                interaction=f"projects/PROJECT_ID/locations/global/interactions/INTERACTION_ID",
                gemini_agent_config=types.GeminiAgentConfig(
                    gemini_agent=AGENT_RESOURCE,
                ),
            ),
        ),
    ]
)

eval_result = client.evals.evaluate(
    dataset=interactions_dataset,
    metrics=[
        types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
    ],
    agent=AGENT_RESOURCE,
)

eval_result.show()

Nächste Schritte

Anleitung

Informationen zum Erstellen, Aktualisieren, Auflisten, Abrufen und Löschen von Agenten mit der REST API.

Anleitung

Informationen zur Interaktion mit Agenten zur Laufzeit, zum Verwalten des Sitzungsstatus und zum dynamischen Überschreiben von Konfigurationen.

Übersicht

Informationen zur Bewertung von KI-Agenten auf der Google Agent Platform.

Anleitung

Informationen zum Verwalten von Bewertungsmesswerten auf der Google Agent Platform.