Die Evaluierung ist ein wichtiges Tool, um die Leistung Ihres Agenten zu testen und sicherzustellen, dass er sich in bestimmten Situationen wie erwartet verhält. Sie können damit Tests automatisieren, Regressionen nach Änderungen erkennen und die Qualität der Antworten Ihres Agenten messen, um die Qualität zu verbessern.
Klicken Sie oben im Agent Builder auf die Schaltfläche Bewerten, um zu beginnen.
Evaluierungskonzepte
Testfall: Jeder Testfall ist ein bestimmtes, in sich abgeschlossenes Testszenario oder ein Prompt, mit dem die Leistung des Agenten bewertet werden soll. Sie können zwei verschiedene Arten von Testfällen erstellen:
- Szenario: Eine KI-basierte Funktion, mit der Sie Ihre Tests schnell starten und eine umfassende Testabdeckung gewährleisten können. Sie beschreiben das Ziel eines Nutzers, und das System simuliert automatisch den Nutzer und generiert Unterhaltungen, um die Fähigkeit des Agenten zu testen, das Szenario zuverlässig zu bewältigen. Szenarien sind eine nützliche Möglichkeit, zu experimentieren und goldene Unterhaltungen zu definieren.
- Golden: Ideal für Regressionstests. Sie geben einen bestimmten „idealen“ Unterhaltungspfad vor. Im Rahmen der Evaluierung wird geprüft, ob das Verhalten des Agenten mit diesem idealen Pfad übereinstimmt, einschließlich der Toolaufrufe.
Ausführung: Eine Evaluierungs-Ausführung stellt eine vollständige, einmalige Ausführung einer Reihe von goldenen und Szenario-Testfällen für die Leistung des Agenten dar, den Sie testen. Jede Ausführung kann einen oder mehrere Testfälle enthalten.
Ergebnis: Ein Ergebnis eines Testfalls bezieht sich auf eine einzelne Ausführung eines bestimmten Testfalls in einer einzelnen Ausführung. Wenn ein Testfall während einer einzelnen Evaluierungsausführung mehrmals ausgeführt wird (z. B. um die Konsistenz oder Unzuverlässigkeit zu prüfen), ist jede einzelne Ausführung ein einzelnes Ergebnis. Die Ergebnisse werden als rechteckige Symbole in Spalten in jeder Testfallzeile angezeigt. Ein rotes X bedeutet, dass die Ausführung fehlgeschlagen ist, ein grünes Häkchen, dass sie erfolgreich war.
Tags: Testfälle können mit Tags gruppiert werden, um die Verwaltung zu erleichtern.
Testfälle erstellen
Wenn Sie Testfälle für Ihren Agenten erstellen und darauf zugreifen möchten, klicken Sie oben im Agent Builder auf die Schaltfläche Bewerten. Sie können goldene oder szenario basierte Testfälle erstellen und verwalten.
Szenario
Bei szenariobasierten Testfällen wird mit KI automatisch eine Vielzahl von Unterhaltungen basierend auf einem von Ihnen definierten übergeordneten Nutzerziel generiert. Bei diesen Testfällen wählen Sie generierte Szenarien aus oder beschreiben bestimmte Szenarien, die getestet werden müssen, anstatt bestimmte goldene Unterhaltungen anzugeben. Dies ist ein leistungsstarkes Tool, mit dem Sie Grenzfälle untersuchen und die Robustheit Ihres Agenten testen können, ohne jeden möglichen Unterhaltungspfad manuell schreiben zu müssen.
Wenn diese Szenarien gut funktionieren, können Sie sie als goldene Unterhaltungen speichern.
So erstellen Sie ein Szenario:
- Klicken Sie auf Szenario erstellen. Es werden mehrere Szenarien vorgeschlagen.
- Sie können entweder Szenarien basierend auf den ausgewählten Optionen generieren oder ein neues Szenario von Grund auf erstellen.
Wenn Sie die Liste der Szenarien aufrufen, können Sie die Details und die Unterhaltungsliste für jedes Szenario aufrufen, indem Sie auf das Szenario klicken.
So speichern Sie ein Szenario als goldene Unterhaltung:
- Wählen Sie das Szenario aus.
- Klicken Sie rechts oben auf die Menüschaltfläche.
- Wählen Sie Als goldene Unterhaltung speichern aus.
Nutzerziel des Szenarios
Jedes Szenario hat ein Nutzerziel, das die Ziele des Endnutzers bei der Verwendung der Agent-Anwendung beschreibt. Beispiel:
Securely book a specific room at a chosen hotel and receive a confirmation.
Basierend auf Ihrem Nutzerziel generiert CX Agent Studio automatisch Unterhaltungen, die für die Evaluierung verwendet werden.
Szenariovariablen
Wenn Sie ein Szenario definieren, können Sie Variablen angeben, die für das Szenario verwendet werden sollen.
Erwartungen an das Szenario
Um eine Evaluierung durchzuführen, definieren Sie Erwartungen für den Testfall.
Es gibt zwei Arten von Erwartungen:
- Nachricht: Eine erwartete Antwort des Agenten.
- Toolaufruf: Ein Toolaufruf mit erwarteten Ein- und Ausgaben.
Erwartungen können die folgenden Bedingungen haben:
- Erforderlich
- Nicht erforderlich
- Nach Toolaufruf
- Variablenwert
So erstellen Sie eine Erwartung:
- Klicken Sie auf ein bestimmtes Szenario, um die Details zu öffnen.
- Klicken Sie im Bereich Erwartungen auf Alle ansehen.
- Folgen Sie der Anleitung auf der Benutzeroberfläche, um Erwartungen für das Szenario zu erstellen.
Golden
Diese Testfälle werden verwendet, um ideale Unterhaltungspfade für Regressionstests zu definieren, damit wichtige Unterhaltungspfade nicht unterbrochen werden, wenn Sie den Agenten aktualisieren. Es gibt mehrere Möglichkeiten, eine goldene Unterhaltung zu erstellen:
So importieren Sie eine Unterhaltung aus dem Simulator:
- Starten Sie eine Unterhaltung mit dem Simulator.
- Klicken Sie rechts oben im Simulator auf das Dreipunkt-Menü, um das Simulatormenü aufzurufen.
- Klicken Sie auf Als golden speichern.
- Geben Sie einen Namen für den goldenen Testfall ein und klicken Sie auf Speichern. Er wird jetzt auf dem Tab Bewertung angezeigt.
So erstellen Sie einen Testfall aus dem Unterhaltungsverlauf:
- Rufen Sie den Tab Bewertung auf.
- Klicken Sie auf + Testfall hinzufügen.
- Wählen Sie Golden aus.
- Klicken Sie auf Weiter.
- Klicken Sie auf Aus Unterhaltungsverlauf auswählen.
- Wählen Sie im angezeigten Fenster die Unterhaltung aus, die Sie als goldenen Testfall speichern möchten. Sie können auch nach Unterhaltungs-ID suchen.
- Wenn Sie die Schwärzung aktiviert haben, prüfen Sie die Antworten und Variablen des Agenten auf Schwärzung, bevor Sie mit fehlenden Informationen fortfahren.
- Klicken Sie auf Hinzufügen.
So erstellen Sie einen Testfall von Grund auf neu:
- Rufen Sie den Tab Bewertung auf.
- Klicken Sie auf + Testfall hinzufügen.
- Wählen Sie Golden aus.
- Klicken Sie auf Weiter.
- Klicken Sie auf Von Grund auf neu erstellen.
- Fügen Sie im angezeigten Fenster einen Anzeigenamen für den Testfall hinzu.
- Fügen Sie nach Bedarf Text für die Nutzereingabe und die Erwartung an den Agenten hinzu. Klicken Sie auf + Nutzereingabe hinzufügen und + Erwartung an den Agenten hinzufügen , um Antworten hinzuzufügen. Klicken Sie auf + Runde hinzufügen , um dem Testfall eine neue Unterhaltungsrunde hinzuzufügen.
- Klicken Sie auf Erstellen , um den goldenen Testfall der Liste der Testfälle hinzuzufügen.
So erstellen Sie einen Testfall aus einer simulierten Unterhaltung in einem Szenario-Testfall:
- Rufen Sie die Seite mit den Ergebnissen der Evaluierungsausführung auf.
- Klicken Sie rechts neben der ausgewählten Unterhaltung auf das Menüsymbol (Dreipunkt-Menü) und dann auf Als goldene Unterhaltung speichern.
So laden Sie Testfälle im Batch-Verfahren aus einer Datei hoch:
Details zum Dateiformat und eine CSV-Vorlage finden Sie auf der Seite CSV-Format für goldene Testfälle.
Erwartungen an goldene Testfälle
Um eine Evaluierung durchzuführen, definieren Sie Erwartungen für den goldenen Testfall. Eine Erwartung ist ein bestimmtes Ergebnis, das Sie vom Agenten zu einem bestimmten Zeitpunkt in der Unterhaltung erwarten. Bei der Evaluierung wird das tatsächliche Verhalten des Agenten mit diesen Erwartungen verglichen.
Es gibt folgende Arten von Erwartungen:
- Nachricht: Eine erwartete Textantwort des Agenten an den Endnutzer. Bei der Evaluierung wird geprüft, ob die Antwort des Agenten semantisch mit dieser Erwartung übereinstimmt.
- Toolaufruf: Eine Erwartung, dass der Agent ein bestimmtes Tool aufruft und eine bestimmte Antwort gibt. Sie können auch erwartete Eingabeargumente für den Toolaufruf angeben.
- Übergabe an einen menschlichen Mitarbeiter: Eine Erwartung, dass der Agent die Unterhaltung an einen menschlichen Mitarbeiter oder einen anderen Bot übergibt.
So erstellen Sie eine Erwartung:
- Klicken Sie auf einen bestimmten goldenen Testfall, um die Details zu öffnen.
- Klicken Sie im Bereich Details auf Golden ansehen.
- Folgen Sie der Anleitung auf der Benutzeroberfläche, um Erwartungen hinzuzufügen oder zu ändern.
Evaluierungseinstellungen
In der Überschriftenzeile der Liste der Testfälle können Sie die Evaluierungseinstellungen konfigurieren:
- Golden:
- Kriterien für das Bestehen/Nichtbestehen von goldenen Testfällen: Legen Sie die Logik fest, nach der eine simulierte Unterhaltung als bestanden oder nicht bestanden gilt.
- Ebene der Unterhaltungsrunde:
Diese Regeln bewerten jede einzelne Unterhaltungsrunde.
Wenn einer dieser Grenzwerte nicht erreicht wird, wird der entsprechende Messwert rot markiert, um anzuzeigen, dass er nicht bestanden wurde.
- Semantische Ähnlichkeit: Grenzwert für die semantische Ähnlichkeit.
- Korrekte Toolnutzung: Grenzwert für die korrekte Toolnutzung.
- KI-Halluzinationen: Wenn diese Option deaktiviert ist, werden KI-Halluzinationen bei der Bewertung, ob der Test bestanden wurde oder nicht, nicht berücksichtigt.
- Ebene der Erwartungen:
Diese Regeln bewerten die Erwartungen innerhalb einer Unterhaltungsrunde.
Wenn einer dieser Grenzwerte nicht erreicht wird, wird der entsprechende Messwert rot markiert, um anzuzeigen, dass er nicht bestanden wurde.
- Korrekte Toolnutzung: Grenzwert für die korrekte Toolnutzung.
- Methode für die Ausführung von goldenen Testfällen: Wählen Sie zwischen naiver oder stabiler Wiedergabevalidierung aus.
- Tool-Fake: Verwenden Sie simulierte Daten anstelle von echten Produktions-API-Aufrufen.
- Scenarios:
- Kriterien für das Bestehen/Nichtbestehen von Szenarien: Legen Sie die Logik fest, nach der eine simulierte Unterhaltung als bestanden oder nicht bestanden gilt.
- Initiator der Unterhaltung: Legen Sie fest, wer die Unterhaltung startet: der Nutzer oder das Modell.
- Tool-Fake: Verwenden Sie simulierte Daten anstelle von echten Produktions-API-Aufrufen.
- Audiobewertung
- Aufnahmen für die Audiobewertung
Evaluierungen ausführen
Wenn Sie eine Evaluierung ausführen möchten, können Sie entweder in der Testfallzeile auf die Schaltfläche „Ausführen“ klicken oder mehrere Testfälle auswählen und sie ausführen.
Wenn Sie mehrere Versionen, gespeichert haben, können Sie auswählen, welche Agent-Version verwendet werden soll, oder Ihren Agent-Entwurf automatisch als neue Version für die Ausführung speichern.
Nach einer Evaluierungsausführung werden die Messwerte aktualisiert und die Ergebnisse angezeigt.
Wenn Sie auf eine bestimmte Evaluierungsausführung klicken, können Sie die detaillierten Ergebnisse für eine Ausführung sehen. Zusätzlich zu den Standardmesswerten werden die folgenden angezeigt:
- Nicht bestandene Unterhaltungsrunden
- Paginierte Liste mit allen Details zu den Unterhaltungsrunden, einschließlich der tatsächlichen und erwarteten Antworten des Agenten.
Bei goldenen Testfällen wird möglicherweise der Begriff „stabile Wiedergabe“ angezeigt, der verdeutlicht, dass der Test in einer konsistenten Umgebung ausgeführt wurde (d.h. ohne Änderung des Kontexts oder der Eingabe).
KI zur Verbesserung von Testfällen verwenden (VORSCHAU)
Optional können Sie KI verwenden, um Fehler bei einer Ausführung zu beheben und Möglichkeiten zur Verbesserung der Agent-Qualität vorzuschlagen. KI-Vorschläge sind optimal, wenn die Anzahl der Ausführungen (Ausführungsanzahl) mindestens 3 beträgt. Wenn Sie KI aktivieren möchten, wählen Sie die Testfälle aus, die Sie bewerten möchten, und klicken Sie auf Auswahl ausführen. Aktivieren Sie im angezeigten Fenster das Kästchen neben Probleme mit KI finden.
Nach Abschluss der Ausführung werden auf der Ergebnisseite KI-basierte Vorschläge angezeigt.
Gemini generiert automatisch einen herunterladbaren loss_report, in dem Aspekte der Leistung des Agenten zusammengefasst und Bereiche hervorgehoben werden, die verbessert werden können.
Alle Nutzer können von KI vorgeschlagene Korrekturen sehen, aber nur die Person, die die Ausführung initiiert hat, kann Maßnahmen basierend auf den Ergebnissen ergreifen.
Klicken Sie auf Gemini fragen , um mit dem Helfer-Agenten zu interagieren. Zuerst sehen Sie den Verlustbericht , in dem allgemeine Probleme mit dem Modell oder Agenten erläutert werden. Sie können den Helfer-Agenten bitten, den Bericht zu erläutern. Er fasst den Bericht zusammen und schlägt möglicherweise Korrekturen vor. Nachdem die Korrekturen angewendet wurden, können Sie den Helfer-Agenten bitten, die Evaluierung noch einmal auszuführen.
Import und Export
Sie können Evaluierungstestfälle, -ausführungen und -ergebnisse im YAML- oder JSON-Format importieren und exportieren. Achten Sie beim Import darauf, dass der empfangende Agent alle Ressourcen (Tools, Variablen und Unteragenten) enthält, die in den exportierten Daten definiert sind.
So exportieren Sie Testfälle:
- Wählen Sie einen oder mehrere Testfälle aus.
- Klicken Sie auf Testfälle exportieren.
- Wählen Sie ein Format aus.
- Eine ZIP-Datei wird heruntergeladen.
So importieren Sie Testfälle:
- Klicken Sie auf + Testfall hinzufügen.
- Wählen Sie Golden aus.
- Klicken Sie auf Weiter.
- Laden Sie die ZIP-Datei hoch.
- Wenn es Konflikte beim Import gibt, werden Sie angeleitet, wie Sie damit umgehen können.
- Klicken Sie auf Erstellen.
So exportieren Sie Evaluierungsausführungen und -ergebnisse:
- Wählen Sie eine oder mehrere Evaluierungsausführungen aus.
- Klicken Sie auf Ausführung exportieren.
- Wählen Sie ein Format aus.
- Eine ZIP-Datei wird heruntergeladen.
Messwerte
Jedes Testfallergebnis enthält eine Reihe von Messwerten, mit denen die Leistung des Agenten anhand der ausgewählten Testfälle gemessen wird. Die Messwerte werden entweder auf Ebene der Unterhaltungsrunde oder auf Ebene der Erwartungen (Unterhaltung) berechnet, wie in der Console angegeben.
In jedem Fall können Sie die Werte, die für das Bestehen der Ausführung erforderlich sind, im Menü Einstellungen auf dem Tab Bewerten anpassen.
Korrekte Toolnutzung
Wird für goldene und Szenario-Testfälle berechnet. Dieser Messwert gibt den Prozentsatz der erwarteten Parameter an, die bei einem erwarteten Toolaufruf und den erwarteten Parameterwerten übereinstimmen. Fehlende Toolaufrufe werden mit 0 bewertet. Toolaufrufe ohne Eingabeparameter werden mit 1 bewertet, sofern vorhanden. Wenn während einer goldenen Evaluierung ein unerwarteter Toolaufruf erfolgt, gilt das Ergebnis als nicht bestanden. Dies hat jedoch keine Auswirkungen auf den Wert für die korrekte Toolnutzung.
Zufriedenheit mit dem Nutzerziel
Wird für Szenarien berechnet. Die Zufriedenheit mit dem Nutzerziel ist ein binärer Messwert, der für Evaluierungen mit Nutzersimulation entwickelt wurde. Er misst, ob der simulierte Nutzer der Meinung ist, dass seine Ziele erreicht wurden (0=nein, 1=ja). Die Eingaben sind das user_goal, wie in der Konfiguration des simulierten Nutzers definiert, und ein Unterhaltungsprotokoll. Wenn das angegebene user_goal kein explizites oder implizites Ziel enthält, ist der Ausgabewert -1.
KI-Halluzinationen
Verfügbar für goldene und Szenario-Testfälle. Die Halluzinationswerte werden für jede generierte Unterhaltungsrunde berechnet. Dieser Messwert gibt an, ob der Agent Behauptungen aufgestellt hat, die nicht durch den Kontext des Agenten gerechtfertigt sind (0=nein, 1=ja). Der Kontext besteht aus allen vorherigen Unterhaltungsrunden, Sitzungsvariablen, Toolaufrufen und Agent-Anweisungen. Dieser Messwert wird nur für Unterhaltungsrunden mit Toolaufrufen berechnet. Er erkennt keine Halluzinationen in Toolaufrufen. Toolaufrufe, die als Kontext bereitgestellt werden, werden als korrekt angenommen. Um falsch positive Ergebnisse zu minimieren, kann der Messwert „N/A“ zurückgeben, wenn eine Antwort keine faktischen Behauptungen oder nur Allgemeinwissen enthält, das bereits bekannt ist.
Sie können KI-Halluzinationen in den Evaluierungseinstellungen aktivieren und deaktivieren.
Semantische Übereinstimmung
Wird für goldene Testfälle berechnet. Dieser Messwert gibt an, inwieweit eine beobachtete Äußerung des Agenten mit einer erwarteten Äußerung des Agenten übereinstimmt. Die semantische Übereinstimmung wird auf Ebene der Unterhaltungsrunde berechnet. Die zurückgegebenen Werte reichen von 0 (völlig inkonsistent oder widersprüchlich) bis 4 (vollständig konsistent).
Erwartungen an das Szenario
Wird für Szenarien berechnet. Dieser Messwert gibt an, ob das Verhalten des Agenten, wie von den simulierten Nutzern erwartet, zufriedenstellend war oder nicht (0=nein, 1=ja). Es werden zwei Arten von Erwartungen an simulierte Nutzer unterstützt:
- Erwartungen an Toolaufrufe: Werden ähnlich wie die Korrektheit von Toolaufrufen
berechnet, mit folgenden Ausnahmen:
- Die Ergebnisse sind entweder 0 (nein) oder 1 (ja).
- Unerwartete Toolaufrufe werden nicht bestraft. Erwartungen sollen die Menge der Toolaufrufe angeben, die erforderlich sind, damit eine Unterhaltung die Erwartungen des simulierten Nutzers erfüllt.
- Wenn eine Erwartung an die Eingabe eines Toolaufrufs erfüllt ist, wird der Aufruf zur Laufzeit abgefangen und durch einen simulierten Rückgabewert ersetzt.
- Erwartungen an die Antworten des Agenten: Prüft, ob eine Antwort des Agenten in der Unterhaltung einen erwarteten String enthält.
Aufgabe abschließen
Wird für Szenarien berechnet. Die Aufgabenabschlüsse sind ein Maß für die Qualität der Unterhaltung. Es wird gemeinsam gemessen, ob die Ziele des Nutzers erreicht wurden UND ob das Verhalten des Agenten korrekt war. Die Definition lautet:
User_Goal_Satisfied AND no_hallucinations_detected AND Expectations Satisfied
Nutzeridentitäten
Nutzeridentitäten sind simulierte Nutzeridentitäten, die Sie anpassen und für Agent-Tests mit Szenario-Testfällen verwenden können. Diese Funktion ist nützlich, um sicherzustellen, dass der Agent angemessen mit den Arten von menschlichen Nutzern interagiert, denen er zur Laufzeit wahrscheinlich begegnen wird.
Wenn Sie keine Nutzeridentität auswählen, wird für jedes Szenarioergebnis eine zufällige Nutzeridentität ausgewählt.
Diese Funktion kann sowohl mit Text- als auch mit Audioeingaben verwendet werden.
Nutzeridentität erstellen
- Wenn Sie eine Nutzeridentität erstellen möchten, rufen Sie den Tab Bewerten auf und klicken Sie neben dem Symbol „Einstellungen“ auf Nutzeridentitäten verwalten.
- Klicken Sie auf + Nutzeridentität hinzufügen.
- Geben Sie im angezeigten Menü einen Namen und eine Nutzerpersönlichkeit sowie zusätzlichen Nutzerkontext ein (z. B. Alter, Standort, Grund für den Anruf).
- Klicken Sie auf + Hinzufügen.
So führen Sie eine Evaluierung mit einer Nutzeridentität aus:
- Kehren Sie zur Hauptseite Bewerten zurück und wählen Sie einen oder mehrere Szenario-Testfälle aus. Klicken Sie auf Auswahl ausführen.
- Wählen Sie im angezeigten Fenster im Drop-down-Menü Nutzeridentitäten die gerade erstellte Nutzeridentität aus und klicken Sie auf Ausführen.