Bewertungsmesswerte verwalten

Hinweis

Bevor Sie Bewertungsmesswerte verwalten, benötigen Sie Folgendes:

  • Ein Google Cloud Projekt, in dem die Agent Platform API aktiviert ist.
  • (Optional) Wenn Sie das Agent Platform SDK verwenden, initialisieren Sie den Client wie unter KI-Agenten bewerten beschrieben.

Mit der Messwertregistrierung können Sie wiederverwendbare Konfigurationen für die Bewertung Ihrer KI-Agenten definieren, speichern und verwalten. Anstatt Kriterien für jeden Testlauf zu konfigurieren, können Sie standardisierte Messwerte speichern, z. B. ein benutzerdefiniertes LLM-basiertes Bewertungsschema für die Sicherheit oder eine Python-Funktion für die Ausführungsgenauigkeit, und sie sowohl für Offline-Bewertungen als auch für kontinuierliche Online-Tests verwenden.

Messwerttypen

Die Agent Platform unterstützt drei Arten von Messwerten in der Registrierung:

  • Vordefinierte Messwerte:Von Google verwaltete Messwerte, einschließlich Multi-Turn-Bewertungen für Aufgabenerfolg, Qualität der Toolnutzung und Einhaltung der Vorgehensweise.
  • Benutzerdefinierte LLM-Messwerte:Bewertungsschemas in natürlicher Sprache, bei denen ein „Judge LLM“ die Antwort eines KI-Agenten anhand Ihrer spezifischen Kriterien und Bewertungsskalen bewertet.
  • Benutzerdefinierte Codemesswerte:Python-Funktionen, mit denen das Verhalten von KI-Agenten programmatisch validiert wird, z. B. durch Überprüfung auf ein bestimmtes Ausgabeformat oder eine Toolantwort.

Neben den von Google bereitgestellten verwalteten Messwerten können Sie auch benutzerdefinierte registrierte Messwerte für die Bewertung verwenden.

Vordefinierte Messwerte

Die Agent Platform bietet eine Reihe vordefinierter Messwerte für die Bewertung von KI-Agenten. Diese Messwerte werden von Google verwaltet und decken gängige Bewertungsdimensionen für Einzel- und Multi-Turn-Interaktionen mit KI-Agenten ab.

Sie können im SDK mit types.RubricMetric.METRIC_NAME auf vordefinierte Messwerte zugreifen. Ausführliche Informationen zu allen verwalteten Bewertungsschema-basierten Messwerten, einschließlich Eingabeanforderungen und Ausgabeformaten, finden Sie unter Details zu verwalteten Bewertungsschema-basierten Messwerten.

Messwerte für Einzel-Turn-KI-Agenten

Mit den folgenden Messwerten wird eine einzelne Interaktion mit einem KI-Agenten bewertet (ein Prompt und eine Antwort, möglicherweise mit Toolaufrufen dazwischen):

Messwert Typ SDK-Accessor Beschreibung
Qualität der endgültigen Antwort des KI-Agenten Adaptives Bewertungsschema types.RubricMetric.FINAL_RESPONSE_QUALITY Umfassende Bewertung, bei der Bewertungsschema-Kriterien automatisch auf Grundlage der Konfiguration des KI-Agenten (Systemanweisungen und Tooldeklarationen) und des Prompts des Nutzers generiert werden.
Halluzination des KI-Agenten Statisches Bewertungsschema types.RubricMetric.HALLUCINATION Überprüft die Faktizität, indem die Antwort in einzelne Behauptungen unterteilt und überprüft wird, ob jede Behauptung auf der Toolnutzung aus Zwischenereignissen basiert.
Qualität der Toolnutzung durch den KI-Agenten Adaptives Bewertungsschema types.RubricMetric.TOOL_USE_QUALITY Bewertet die Auswahl geeigneter Tools, die korrekte Verwendung von Parametern und die Einhaltung der angegebenen Reihenfolge von Vorgängen.
Sicherheit Statisches Bewertungsschema types.RubricMetric.SAFETY Bewertet, ob die Antwort gegen Sicherheitsrichtlinien verstößt, einschließlich personenbezogener Daten und demografischer Daten, Hassreden, gefährlicher Inhalte, Belästigung oder sexuell expliziter Inhalte. Gibt 1 für sicher und 0 für unsicher zurück.

Messwerte für Multi-Turn-KI-Agenten

Mit den folgenden Messwerten werden Multi-Turn-Unterhaltungen mit KI-Agenten bewertet. Dabei wird der gesamte Unterhaltungskontext analysiert, um die Gesamtleistung des KI-Agenten über mehrere Runden hinweg zu bewerten:

Messwert Typ SDK-Accessor Beschreibung
Erfolg von Multi-Turn-Aufgaben des KI-Agenten Adaptives Bewertungsschema types.RubricMetric.MULTI_TURN_TASK_SUCCESS Bewertet, ob der KI-Agent das Ziel oder die Ziele der Unterhaltung erreicht hat. Dieser referenzfreie Messwert konzentriert sich darauf, ob das Ziel erreicht wurde, nicht wie es erreicht wurde.
Qualität der Multi-Turn-Toolnutzung des KI-Agenten Adaptives Bewertungsschema types.RubricMetric.MULTI_TURN_TOOL_USE_QUALITY Bewertet die Qualität der Funktionsaufrufe, die während einer Multi-Turn Unterhaltung erfolgt sind. Bewertet, ob der KI-Agent die richtigen Tools mit den richtigen Argumenten zum richtigen Zeitpunkt aufgerufen hat.
Qualität der Multi-Turn-Vorgehensweise des KI-Agenten Adaptives Bewertungsschema types.RubricMetric.MULTI_TURN_TRAJECTORY_QUALITY Bewertet die gesamte Vorgehensweise (Pfad) der Unterhaltung. Im Gegensatz zum Aufgabenerfolg wird mit diesem Messwert bewertet, wie der KI-Agent das Ziel erreicht hat, also ob der logische Pfad effizient war.

Vordefinierte Messwerte im SDK verwenden

from vertexai import evals, types

# Run an evaluation with predefined metrics
result = client.evals.evaluate(
    dataset=eval_dataset,
    metrics=[
        types.RubricMetric.FINAL_RESPONSE_QUALITY,
        types.RubricMetric.TOOL_USE_QUALITY,
        types.RubricMetric.HALLUCINATION,
        types.RubricMetric.SAFETY,
    ],
)

# Visualize results in Colab
result.show()

Messwerte in der Console verwalten

  1. Rufen Sie in der Google Cloud Console die Seite Agent Platform > KI-Agenten > Bewertung auf.

    Zur Bewertung

  2. Klicken Sie auf den Tab Messwerte , um die Registrierung aufzurufen.

  3. Messwert erstellen:Klicken Sie auf Neuer Messwert und wählen Sie Benutzerdefinierter LLM-Messwert oder Benutzerdefinierter Codemesswert aus.

  4. Bewertungsschemas definieren:Verwenden Sie für LLM-Messwerte die Schaltflächen Beispiel , um Anweisungen, Kriterien (z. B. Klarheit oder Begeisterung) und Bewertungsergebnisse schnell einzufügen.

  5. Ansehen und bearbeiten: Klicken Sie auf einen beliebigen Messwertnamen, um die Definition im schreibgeschützten Modus aufzurufen. Mit dem Dreipunkt-Menü Weitere Optionen können Sie die Ressource duplizieren oder löschen.

Messwerte mit dem SDK verwalten

Sie können Messwerte programmatisch mit dem Agent Platform SDK registrieren und verwenden.

Benutzerdefinierten LLM-Messwert registrieren

from vertexai import evals, types

# Define a metric with a specific rubric
tone_check_metric = types.LLMMetric(
        name="tone_check",
        prompt_template="Analyze the tone of the response ...",
        result_parsing_function="""
          import json, re
          def parse_results(responses):
              response = json.loads(responses[0])
              return {"score": response.get("score", 0.0),
                      "explanation": response.get("explanation", "default explanation")}
          """
)

# Register the custom metric
tone_check_metric_path = client.evals.create_evaluation_metric(
    metric=tone_check_metric
)

Benutzerdefinierten Codemesswert registrieren

from vertexai import evals, types

# Define a metric with custom python code
accuracy_metric_code = """
def evaluate(instance: dict) -> float:
    agent_data = instance.get('agent_eval_data', {})
    turns = agent_data.get('turns', [])
    for turn in turns:
        ...
"""

accuracy_metric = types.CodeExecutionMetric(
    name="multi_turn_accuracy",
    custom_function=accuracy_metric_code
)

# Register the custom metric
accuracy_metric_path = client.evals.create_evaluation_metric(
    metric=accuracy_metric
)