Tool: get_evaluation
Ruft Details zur angegebenen Auswertung ab.
Das folgende Codebeispiel zeigt, wie Sie mit curl das MCP-Tool get_evaluation aufrufen.
| Curl-Anfrage |
|---|
curl --location 'https://ces.googleapis.com/mcp' \ --header 'content-type: application/json' \ --header 'accept: application/json, text/event-stream' \ --data '{ "method": "tools/call", "params": { "name": "get_evaluation", "arguments": { // provide these details according to the tool's MCP specification } }, "jsonrpc": "2.0", "id": 1 }' |
Eingabeschema
Anfragenachricht für EvaluationService.GetEvaluation.
GetEvaluationRequest
| JSON-Darstellung |
|---|
{ "name": string } |
| Felder | |
|---|---|
name |
Erforderlich. Der Ressourcenname der abzurufenden Bewertung. |
Ausgabeschema
Eine Evaluierung umfasst alle Informationen, die zum Simulieren und Bewerten eines Agenten erforderlich sind.
Bewertung
| JSON-Darstellung |
|---|
{ "name": string, "displayName": string, "description": string, "tags": [ string ], "evaluationDatasets": [ string ], "createTime": string, "createdBy": string, "updateTime": string, "lastUpdatedBy": string, "evaluationRuns": [ string ], "etag": string, "aggregatedMetrics": { object ( |
| Felder | |
|---|---|
name |
ID. Die eindeutige Kennung dieser Auswertung. Format: |
displayName |
Erforderlich. Benutzerdefinierter Anzeigename der Auswertung. Eindeutig innerhalb einer App. |
description |
Optional. Benutzerdefinierte Beschreibung der Auswertung. |
tags[] |
Optional. Benutzerdefinierte Tags zum Kategorisieren der Auswertung. |
evaluationDatasets[] |
Nur Ausgabe. Liste der Bewertungs-Datasets, zu denen die Bewertung gehört. Format: |
createTime |
Nur Ausgabe. Zeitstempel für die Erstellung der Bewertung. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
createdBy |
Nur Ausgabe. Der Nutzer, der die Auswertung erstellt hat. |
updateTime |
Nur Ausgabe. Zeitstempel der letzten Aktualisierung der Bewertung. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
lastUpdatedBy |
Nur Ausgabe. Der Nutzer, der die Auswertung zuletzt aktualisiert hat. |
evaluationRuns[] |
Nur Ausgabe. Die EvaluationRuns, mit denen diese Evaluation verknüpft ist. |
etag |
Nur Ausgabe. Etag, das verwendet wird, um sicherzustellen, dass sich das Objekt während eines Read-Modify-Write-Vorgangs nicht geändert hat. Wenn das ETag leer ist, werden alle gleichzeitigen Änderungen durch das Update überschrieben. |
aggregatedMetrics |
Nur Ausgabe. Die aggregierten Messwerte für diese Auswertung über alle Läufe hinweg. |
lastCompletedResult |
Nur Ausgabe. Das letzte Bewertungsergebnis für diese Bewertung. |
invalid |
Nur Ausgabe. Gibt an, ob die Auswertung ungültig ist. Das kann passieren, wenn in einer Auswertung auf ein Tool, Toolset oder einen Agent verwiesen wird, das bzw. der inzwischen gelöscht wurde. |
lastTenResults[] |
Nur Ausgabe. Die letzten 10 Bewertungsergebnisse für diese Bewertung. Dieses Feld wird nur ausgefüllt, wenn „include_last_ten_results“ in „ListEvaluationsRequest“ oder „GetEvaluationRequest“ auf „true“ gesetzt ist. |
evaluationMetricsThresholdOverride |
Optional. Überschreibt die Messwertschwellenwerte für diese spezifische Bewertung. |
evaluationMetricsConfigOverride |
Optional. Überschreibt die Messwertekonfiguration für diese spezifische Bewertung. |
Union-Feld inputs. Für die Eingaben für die Auswertung inputs ist nur einer der folgenden Werte zulässig: |
|
golden |
Optional. Die zu bewertenden goldenen Schritte. |
scenario |
Optional. Die Konfiguration für ein Szenario. |
Golden
| JSON-Darstellung |
|---|
{
"turns": [
{
object ( |
| Felder | |
|---|---|
turns[] |
Erforderlich. Die Anzahl der goldenen Turns, die zum Wiederholen einer goldenen Unterhaltung erforderlich sind. Die maximal zulässige Anzahl von Zügen beträgt 100. |
evaluationExpectations[] |
Optional. Die Erwartungen für die Bewertung, anhand derer das wiedergegebene Gespräch bewertet werden soll. Format: |
GoldenTurn
| JSON-Darstellung |
|---|
{ "steps": [ { object ( |
| Felder | |
|---|---|
steps[] |
Erforderlich. Die Schritte, die zum Wiederholen einer goldenen Unterhaltung erforderlich sind. |
rootSpan |
Optional. Der Stamm-Spanne des goldenen Turns für die Verarbeitung und Verwaltung von Audioinformationen. Die URI für die Audioinhalte muss Audioinhalte mit einer Abtastrate von 16 kHz enthalten. |
turnLevelMetricsThresholdsOverride |
Optional. Überschreibungen für Messwertgrenzwerte auf Turn-Ebene. |
hallucinationMetricBehaviorOverride |
Optional. Überschreiben für das Verhalten des Messwerts für Halluzinationen auf Turn-Ebene. |
Schritt
| JSON-Darstellung |
|---|
{ // Union field |
| Felder | |
|---|---|
Union-Feld step. Der auszuführende Schritt. Für step ist nur einer der folgenden Werte zulässig: |
|
userInput |
Optional. Nutzereingabe für die Unterhaltung. |
agentTransfer |
Optional. Leiten Sie die Unterhaltung an einen anderen Kundenservicemitarbeiter weiter. |
expectation |
Optional. Führt eine Erwartung für den aktuellen Zug aus. |
SessionInput
| JSON-Darstellung |
|---|
{ "willContinue": boolean, // Union field |
| Felder | |
|---|---|
willContinue |
Optional. Ein Flag, das angibt, ob die aktuelle Nachricht ein Fragment einer größeren Eingabe in der bidirektionalen Streaming-Sitzung ist. Wenn HINWEIS: Dieses Feld gilt nicht für Audio- und DTMF-Eingaben, da diese immer automatisch auf Grundlage des Endpunkt-Signals verarbeitet werden. |
Union-Feld input_type. Der Typ der Eingabe. Für input_type ist nur einer der folgenden Werte zulässig: |
|
text |
Optional. Textdaten vom Endnutzer. |
dtmf |
Optional. DTMF-Ziffern vom Endnutzer. |
audio |
Optional. Audiodaten des Endnutzers. Ein base64-codierter String. |
toolResponses |
Optional. Ausführungsergebnisse für die Tool-Aufrufe vom Client. |
image |
Optional. Bilddaten vom Endnutzer. |
blob |
Optional. Blob-Daten vom Endnutzer. |
variables |
Optional. Kontextbezogene Variablen für die Sitzung, nach Namen sortiert. Der CES-Kundenservicemitarbeiter verwendet nur Variablen, die in der App deklariert sind. Nicht erkannte Variablen werden weiterhin als zusätzliche Sitzungsparameter an den [Dialogflow-Agent][Agent.RemoteDialogflowAgent] gesendet. |
event |
Optional. Eingabe von Ereignissen |
ToolResponses
| JSON-Darstellung |
|---|
{
"toolResponses": [
{
object ( |
| Felder | |
|---|---|
toolResponses[] |
Optional. Die Liste der Ergebnisse der Tool-Ausführung. |
ToolResponse
| JSON-Darstellung |
|---|
{ "id": string, "displayName": string, "response": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Felder | |
|---|---|
id |
Optional. Die ID zum Abgleich des |
displayName |
Nur Ausgabe. Anzeigename des Tools. |
response |
Erforderlich. Das Ergebnis der Tool-Ausführung im JSON-Objektformat. Verwenden Sie den Schlüssel „output“, um die Tool-Antwort anzugeben, und den Schlüssel „error“, um Fehlerdetails anzugeben (falls vorhanden). Wenn die Schlüssel „output“ und „error“ nicht angegeben sind, wird die gesamte „response“ als Ergebnis der Tool-Ausführung behandelt. |
parentToolCallId |
Nur Ausgabe. Die ID des Tool-Aufrufs, der diesen Aufruf verursacht hat, wenn er von einem untergeordneten Agenten im Namen eines übergeordneten Aufrufs ausgegeben wurde. Leer für Aufrufe der obersten Ebene. Ermöglicht es einem Client, die Arbeit eines untergeordneten Agents unter dem Aufruf zu gruppieren, der ihn gestartet hat, anstatt jeden Schritt als gleichgeordnetes Element darzustellen. |
agentName |
Nur Ausgabe. Ein menschenlesbarer Name des KI-Agenten, der diesen Aufruf ausgegeben hat, z.B. „Contract Architect“. Leer, wenn der Root-Agent die Anfrage gestellt hat. |
Union-Feld tool_identifier. Die Kennung des Tools, das ausgeführt wurde. Es kann sich entweder um ein dauerhaftes Tool oder ein Tool aus einem Toolset handeln. Für tool_identifier ist nur einer der folgenden Werte zulässig: |
|
tool |
Optional. Der Name des auszuführenden Tools. Format: |
toolsetTool |
Optional. Das Toolset-Tool, das ausgeführt wurde. |
ToolsetTool
| JSON-Darstellung |
|---|
{ "toolset": string, "toolId": string } |
| Felder | |
|---|---|
toolset |
Erforderlich. Der Ressourcenname des Toolsets, aus dem dieses Tool abgeleitet wird. Format: |
toolId |
Optional. Die Tool-ID, nach der die Tools gefiltert werden sollen, um das Schema abzurufen. |
Struct
| JSON-Darstellung |
|---|
{ "fields": { string: value, ... } } |
| Felder | |
|---|---|
fields |
Ungeordnete Zuordnung von dynamisch typisierten Werten. Ein Objekt, das eine Liste von |
FieldsEntry
| JSON-Darstellung |
|---|
{ "key": string, "value": value } |
| Felder | |
|---|---|
key |
|
value |
|
Wert
| JSON-Darstellung |
|---|
{ // Union field |
| Felder | |
|---|---|
Union-Feld kind. Die Art des Werts. Für kind ist nur einer der folgenden Werte zulässig: |
|
nullValue |
Stellt ein JSON- |
numberValue |
Stellt eine JSON-Zahl dar. Darf nicht |
stringValue |
Stellt einen JSON-String dar. |
boolValue |
Stellt einen booleschen JSON-Wert dar ( |
structValue |
Stellt ein JSON-Objekt dar. |
listValue |
Stellt ein JSON-Array dar. |
ListValue
| JSON-Darstellung |
|---|
{ "values": [ value ] } |
| Felder | |
|---|---|
values[] |
Wiederkehrendes Feld mit dynamisch typisierten Werten. |
Bild
| JSON-Darstellung |
|---|
{ "mimeType": string, "data": string } |
| Felder | |
|---|---|
mimeType |
Erforderlich. Der IANA-Standard-MIME-Typ der Quelldaten. Unterstützte Bildtypen: * image/png * image/jpeg * image/webp |
data |
Erforderlich. Rohbyte des Bildes. Ein base64-codierter String. |
Blob
| JSON-Darstellung |
|---|
{ "mimeType": string, "data": string } |
| Felder | |
|---|---|
mimeType |
Erforderlich. Der IANA-Standard-MIME-Typ der Quelldaten. |
data |
Erforderlich. Rohbyte des Blobs. Ein base64-codierter String. |
Ereignis
| JSON-Darstellung |
|---|
{ "event": string } |
| Felder | |
|---|---|
event |
Erforderlich. Der Name des Ereignisses. |
AgentTransfer
| JSON-Darstellung |
|---|
{ "targetAgent": string, "displayName": string } |
| Felder | |
|---|---|
targetAgent |
Erforderlich. Der Agent, an den die Unterhaltung übertragen wird. Der Agent übernimmt die Unterhaltung ab diesem Punkt. Format: |
displayName |
Nur Ausgabe. Anzeigename des KI-Agenten. |
GoldenExpectation
| JSON-Darstellung |
|---|
{ "note": string, "skipEvaluation": boolean, "expectationLevelMetricsThresholdsOverride": { object ( |
| Felder | |
|---|---|
note |
Optional. Eine Anmerkung zu dieser Anforderung, die beim Melden hilfreich ist, wenn bestimmte Prüfungen fehlschlagen. Beispiel: "Check_Payment_Tool_Called". |
skipEvaluation |
Optional. Wenn auf „true“ gesetzt, wird diese bestimmte Erwartung nicht ausgewertet. |
expectationLevelMetricsThresholdsOverride |
Optional. Überschreibt Messwerte auf Schrittebene. |
agentResponseSemanticSimilarityMetricsConfigOverride |
Optional. Überschreibungen für Messwerte zur semantischen Ähnlichkeit von Agentenantworten. |
agentResponseHallucinationMetricsConfigOverride |
Optional. Überschreibungen für Messwerte für Halluzinationen in Agent-Antworten. |
comparisonType |
Optional. Der Vergleichstyp, der für die Erwartungsprüfung verwendet werden soll. |
Union-Feld condition. Die tatsächlich durchzuführende Prüfung. Für condition ist nur einer der folgenden Werte zulässig: |
|
toolCall |
Optional. Prüfen Sie, ob ein bestimmtes Tool mit den Parametern aufgerufen wurde. |
toolResponse |
Optional. Prüfen Sie, ob ein bestimmtes Tool die erwartete Antwort gegeben hat. |
agentResponse |
Optional. Prüfen Sie, ob der KI-Agent mit der richtigen Antwort reagiert hat. Die Rolle „Agent“ ist impliziert. |
agentTransfer |
Optional. Prüfen Sie, ob der Agent die Unterhaltung an einen anderen Agenten weitergeleitet hat. |
updatedVariables |
Optional. Prüfen Sie, ob der Agent die Sitzungsvariablen auf die erwarteten Werte aktualisiert hat. Wird auch verwendet, um Agent-Variablen-Updates für Golden Evals zu erfassen. |
mockToolResponse |
Optional. Die Tool-Antwort auf den Mock mit den angegebenen relevanten Parametern. Alle nicht angegebenen Parameter werden vom LLM halluziniert. |
noToolCalls |
Optional. Prüfen Sie, ob in diesem Zug keine Tools aufgerufen wurden. |
ToolCall
| JSON-Darstellung |
|---|
{ "id": string, "displayName": string, "args": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Felder | |
|---|---|
id |
Optional. Die eindeutige ID des Tool-Aufrufs. Wenn das Feld ausgefüllt ist, sollte der Client das Ausführungsergebnis mit der ID zum Abgleich in |
displayName |
Nur Ausgabe. Anzeigename des Tools. |
args |
Optional. Die Eingabeparameter und ‑werte für das Tool im JSON-Objektformat. |
parentToolCallId |
Nur Ausgabe. Die ID des Tool-Aufrufs, der diesen Aufruf verursacht hat, wenn er von einem untergeordneten Agenten im Namen eines übergeordneten Aufrufs ausgegeben wurde. Leer für Aufrufe der obersten Ebene. Ermöglicht es einem Client, die Arbeit eines untergeordneten Agents unter dem Aufruf zu gruppieren, der ihn gestartet hat, anstatt jeden Schritt als gleichgeordnetes Element darzustellen. |
agentName |
Nur Ausgabe. Ein menschenlesbarer Name des KI-Agenten, der diesen Aufruf ausgegeben hat, z.B. „Contract Architect“. Leer, wenn der Root-Agent die Anfrage gestellt hat. |
Union-Feld tool_identifier. Die Kennung des auszuführenden Tools. Es kann sich entweder um ein dauerhaftes Tool oder ein Tool aus einem Toolset handeln. Für tool_identifier ist nur einer der folgenden Werte zulässig: |
|
tool |
Optional. Der Name des auszuführenden Tools. Format: |
toolsetTool |
Optional. Das Toolset-Tool, das ausgeführt werden soll. |
Nachricht
| JSON-Darstellung |
|---|
{
"role": string,
"chunks": [
{
object ( |
| Felder | |
|---|---|
role |
Optional. Die Rolle in der Unterhaltung, z.B. „user“ (Nutzer) oder „agent“ (Agent). |
chunks[] |
Optional. Inhalt der Nachricht als Reihe von Chunks. |
eventTime |
Optional. Zeitstempel für das Senden oder Empfangen der Nachricht. Sollte nicht verwendet werden, wenn die Nachricht Teil einer Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
Chunk
| JSON-Darstellung |
|---|
{ // Union field |
| Felder | |
|---|---|
Union-Feld data. Daten in Blöcke aufteilen. Für data ist nur einer der folgenden Werte zulässig: |
|
text |
Optional. Textdaten. |
transcript |
Optional. Transkript, das mit dem Audio verknüpft ist. |
blob |
Optional. Blob-Daten. |
payload |
Optional. Benutzerdefinierte Nutzlastdaten. |
image |
Optional. Bilddaten. |
toolCall |
Optional. Anfrage zur Toolausführung. |
toolResponse |
Optional. Antwort auf die Toolausführung. |
agentTransfer |
Optional. Ereignis für die Übertragung von Agenten. |
updatedVariables |
Ein Struct stellt Variablen dar, die in der Unterhaltung aktualisiert wurden, wobei die Variablennamen als Schlüssel verwendet werden. |
defaultVariables |
Eine Struktur stellt Standardvariablen zu Beginn der Unterhaltung dar, die nach Variablennamen sortiert sind. |
Zeitstempel
| JSON-Darstellung |
|---|
{ "seconds": string, "nanos": integer } |
| Felder | |
|---|---|
seconds |
Stellt Sekunden der UTC-Zeit seit Unix-Epoche 1970-01-01T00:00:00Z dar. Muss einschließlich zwischen -62135596800 und 253402300799 liegen (entspricht 0001-01-01T00:00:00Z bis 9999-12-31T23:59:59Z). |
nanos |
Nicht negative Sekundenbruchteile Nanosekunden-Auflösung. Dieses Feld enthält den Nanosekundenanteil der Dauer und ist keine Alternative zu Sekunden. Negative Sekundenwerte mit Bruchteilen müssen weiterhin nicht negative Nano-Werte haben, die zeitlich vorwärts gezählt werden. Muss zwischen 0 und 999.999.999 liegen (einschließlich). |
ExpectationLevelMetricsThresholds
| JSON-Darstellung |
|---|
{ // Union field |
| Felder | |
|---|---|
Union-Feld Für |
|
toolInvocationParameterCorrectnessThreshold |
Optional. Der Erfolgsschwellenwert für die Richtigkeit einzelner Parameter für den Toolaufruf. Muss eine Gleitkommazahl zwischen 0 und 1 sein. Der Standardwert ist 1,0. |
SemanticSimilarityMetricsConfig
| JSON-Darstellung |
|---|
{ "enableSemanticSimilarityMetrics": boolean } |
| Felder | |
|---|---|
enableSemanticSimilarityMetrics |
Optional. Gibt an, ob semantische Ähnlichkeitsmesswerte für die Bewertung berechnet werden sollen. |
HallucinationMetricsConfig
| JSON-Darstellung |
|---|
{ "enableHallucinationMetrics": boolean } |
| Felder | |
|---|---|
enableHallucinationMetrics |
Optional. Gibt an, ob Halluzinationsmesswerte für die Bewertung berechnet werden sollen. |
Span
| JSON-Darstellung |
|---|
{
"name": string,
"startTime": string,
"endTime": string,
"duration": string,
"attributes": {
object
},
"childSpans": [
{
object ( |
| Felder | |
|---|---|
name |
Nur Ausgabe. Der Name des Zeitraums. |
startTime |
Nur Ausgabe. Die Startzeit des Zeitraums. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
endTime |
Nur Ausgabe. Die Endzeit des Spans. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
duration |
Nur Ausgabe. Die Dauer des Zeitraums. Die Dauer in Sekunden mit bis zu neun Nachkommastellen und am Ende mit „ |
attributes |
Nur Ausgabe. Schlüssel/Wert-Attribute, die dem Bereich zugeordnet sind. |
childSpans[] |
Nur Ausgabe. Die untergeordneten Spannen, die unter dieser Spanne verschachtelt sind. |
Dauer
| JSON-Darstellung |
|---|
{ "seconds": string, "nanos": integer } |
| Felder | |
|---|---|
seconds |
Vorzeichenbehaftete Sekunden des Zeitraums. Muss zwischen -315.576.000.000 und +315.576.000.000 (einschließlich) liegen. Hinweis: Diese Grenzwerte werden so berechnet: 60 Sek./Min. × 60 Min./Std. × 24 Std./Tag × 365,25 Tage/Jahr × 10.000 Jahre |
nanos |
Signierte Sekundenbruchteile mit Nanosekunden-Auflösung des Zeitraums. Dauern von weniger als einer Sekunde werden mit dem Feld |
TurnLevelMetricsThresholds
| JSON-Darstellung |
|---|
{ "semanticSimilarityChannel": enum ( |
| Felder | |
|---|---|
semanticSimilarityChannel |
Optional. Der semantische Ähnlichkeitschannel, der für die Bewertung verwendet werden soll. |
Union-Feld Für |
|
semanticSimilaritySuccessThreshold |
Optional. Der Erfolgsschwellenwert für die semantische Ähnlichkeit. Muss eine Ganzzahl zwischen 0 und 4 sein. Der Standardwert ist >= 3. |
Union-Feld Für |
|
overallToolInvocationCorrectnessThreshold |
Optional. Der Schwellenwert für die Richtigkeit des Toolaufrufs insgesamt. Muss eine Gleitkommazahl zwischen 0 und 1 sein. Der Standardwert ist 1,0. |
Szenario
| JSON-Darstellung |
|---|
{ "task": string, "userFacts": [ { object ( |
| Felder | |
|---|---|
task |
Erforderlich. Die Aufgabe, auf die sich das Szenario bezieht. |
userFacts[] |
Optional. Die vom Szenario zu verwendenden Nutzerfakten. |
maxTurns |
Optional. Die maximale Anzahl der zu simulierenden Züge. Der maximal zulässige Wert ist 100. Der Standardwert ist 100. |
rubrics[] |
Erforderlich. Die Rubriken, anhand derer das Szenario bewertet wird. |
scenarioExpectations[] |
Erforderlich. Die ScenarioExpectations zum Bewerten der von der Nutzersimulation erstellten Unterhaltung. |
variableOverrides |
Optional. Variablen / Sitzungsparameter als Kontext für die Sitzung, nach Variablennamen sortiert. Mit den Mitgliedern dieser Struktur werden alle vom System festgelegten Standardwerte überschrieben. Diese unterscheiden sich von Nutzerfakten, die dem Nutzer bekannt sind. Variablen sind Parameter, die dem Agent bekannt sind, z.B. die vom Telefonsystem übergebene MDN (Telefonnummer). |
taskCompletionBehavior |
Optional. Verworfen Verwenden Sie stattdessen user_goal_behavior. |
userGoalBehavior |
Optional. Das erwartete Verhalten des Nutzerziels. |
evaluationExpectations[] |
Optional. Die Erwartungen an die Bewertung, anhand derer die von der Simulation erstellte Unterhaltung bewertet wird. Format: |
scenarioExecutionMode |
Optional. Der Ausführungsmodus für Szenariobewertungen. |
UserFact
| JSON-Darstellung |
|---|
{ "name": string, "value": string } |
| Felder | |
|---|---|
name |
Erforderlich. Der Name der Nutzerinformation. |
value |
Erforderlich. Der Wert der Nutzerinformation. |
ScenarioExpectation
| JSON-Darstellung |
|---|
{ // Union field |
| Felder | |
|---|---|
Union-Feld expectation. Die Erwartung, die von der Simulation erstellte Unterhaltung zu bewerten. Für expectation ist nur einer der folgenden Werte zulässig: |
|
toolExpectation |
Optional. Das zu bewertende Tool-Aufruf- und Antwortpaar. |
agentResponse |
Optional. Die zu bewertende Antwort des KI-Agenten. |
ToolExpectation
| JSON-Darstellung |
|---|
{ "expectedToolCall": { object ( |
| Felder | |
|---|---|
expectedToolCall |
Erforderlich. Der erwartete Toolaufruf mit den angegebenen Parametern. Alle nicht angegebenen Parameter werden vom LLM halluziniert. |
mockToolResponse |
Erforderlich. Die Tool-Antwort auf den Mock mit den angegebenen relevanten Parametern. Alle nicht angegebenen Parameter werden vom LLM halluziniert. |
AggregatedMetrics
| JSON-Darstellung |
|---|
{
"metricsByAppVersion": [
{
object ( |
| Felder | |
|---|---|
metricsByAppVersion[] |
Nur Ausgabe. Zusammengefasste Messwerte, gruppiert nach App-Versions-ID. |
MetricsByAppVersion
| JSON-Darstellung |
|---|
{ "appVersionId": string, "toolMetrics": [ { object ( |
| Felder | |
|---|---|
appVersionId |
Nur Ausgabe. Die App-Versions-ID. |
toolMetrics[] |
Nur Ausgabe. Messwerte für jedes Tool in dieser App-Version. |
semanticSimilarityMetrics[] |
Nur Ausgabe. Messwerte für die semantische Ähnlichkeit in dieser App-Version. |
hallucinationMetrics[] |
Nur Ausgabe. Messwerte für Halluzinationen in dieser App-Version. |
toolCallLatencyMetrics[] |
Nur Ausgabe. Messwerte für die Latenz von Tool-Aufrufen in dieser App-Version. |
turnLatencyMetrics[] |
Nur Ausgabe. Messwerte für die Zuglatenz in dieser App-Version. |
passCount |
Nur Ausgabe. Die Anzahl der bestandenen Auswertungen. |
failCount |
Nur Ausgabe. Die Anzahl der fehlgeschlagenen Auswertungen. |
metricsByTurn[] |
Nur Ausgabe. Messwerte, die pro Zug in dieser App-Version zusammengefasst werden. |
ToolMetrics
| JSON-Darstellung |
|---|
{ "tool": string, "passCount": integer, "failCount": integer } |
| Felder | |
|---|---|
tool |
Nur Ausgabe. Der Name des Tools. |
passCount |
Nur Ausgabe. Die Anzahl der Durchläufe des Tools. |
failCount |
Nur Ausgabe. Die Anzahl der fehlgeschlagenen Ausführungen des Tools. |
SemanticSimilarityMetrics
| JSON-Darstellung |
|---|
{ "score": number } |
| Felder | |
|---|---|
score |
Nur Ausgabe. Der durchschnittliche Wert für die semantische Ähnlichkeit (0–4). |
HallucinationMetrics
| JSON-Darstellung |
|---|
{ "score": number } |
| Felder | |
|---|---|
score |
Nur Ausgabe. Der durchschnittliche Halluzinationswert (0 bis 1). |
ToolCallLatencyMetrics
| JSON-Darstellung |
|---|
{ "tool": string, "averageLatency": string } |
| Felder | |
|---|---|
tool |
Nur Ausgabe. Der Name des Tools. |
averageLatency |
Nur Ausgabe. Die durchschnittliche Latenz der Toolaufrufe. Die Dauer in Sekunden mit bis zu neun Nachkommastellen und am Ende mit „ |
TurnLatencyMetrics
| JSON-Darstellung |
|---|
{ "averageLatency": string } |
| Felder | |
|---|---|
averageLatency |
Nur Ausgabe. Die durchschnittliche Latenz der Unterhaltungen. Die Dauer in Sekunden mit bis zu neun Nachkommastellen und am Ende mit „ |
MetricsByTurn
| JSON-Darstellung |
|---|
{ "turnIndex": integer, "toolMetrics": [ { object ( |
| Felder | |
|---|---|
turnIndex |
Nur Ausgabe. Der nullbasierte Index der Kurve. |
toolMetrics[] |
Nur Ausgabe. Messwerte für jedes Tool in diesem Zug. |
semanticSimilarityMetrics[] |
Nur Ausgabe. Messwerte für die semantische Ähnlichkeit in diesem Turn. |
hallucinationMetrics[] |
Nur Ausgabe. Messwerte für Halluzinationen in dieser Antwort. |
toolCallLatencyMetrics[] |
Nur Ausgabe. Messwerte für die Latenz von Tool-Aufrufen in diesem Turn. |
turnLatencyMetrics[] |
Nur Ausgabe. Messwerte für die Antwortlatenz in diesem Zug. |
EvaluationResult
| JSON-Darstellung |
|---|
{ "name": string, "displayName": string, "createTime": string, "evaluationStatus": enum ( |
| Felder | |
|---|---|
name |
ID. Die eindeutige Kennung des Auswertungsergebnisses. Format: |
displayName |
Erforderlich. Anzeigename des Bewertungsergebnisses. Eindeutig innerhalb einer Bewertung. Standardmäßig hat sie das folgende Format: „ |
createTime |
Nur Ausgabe. Zeitstempel für die Erstellung des Bewertungsergebnisses. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
evaluationStatus |
Nur Ausgabe. Das Ergebnis der Bewertung. Wird nur ausgefüllt, wenn „execution_state“ COMPLETE ist. |
evaluationRun |
Nur Ausgabe. Der Bewertungsdurchlauf, der dieses Ergebnis erzeugt hat. Format: |
persona |
Nur Ausgabe. Die Persona, die zum Generieren der Unterhaltung für das Bewertungsergebnis verwendet wurde. |
errorInfo |
Nur Ausgabe. Fehlerinformationen für das Bewertungsergebnis. |
error |
Nur Ausgabe. Nicht mehr unterstützt: Verwenden Sie stattdessen |
initiatedBy |
Nur Ausgabe. Der Nutzer, der den Testlauf initiiert hat, der zu diesem Ergebnis geführt hat. |
appVersion |
Nur Ausgabe. Die App-Version, die zum Generieren der Konversation verwendet wurde, die zu diesem Ergebnis geführt hat. Format: |
appVersionDisplayName |
Nur Ausgabe. Der Anzeigename des |
changelog |
Nur Ausgabe. Das Änderungsprotokoll der App-Version, für die die Überprüfung ausgeführt wurde. Dieses Feld wird ausgefüllt, wenn der Nutzer die Auswertung für die aktuelle Version oder den aktuellen Entwurf ausführt. |
changelogCreateTime |
Nur Ausgabe. Die Erstellungszeit des Änderungsprotokolls der App-Version, für die die Überprüfung ausgeführt wurde. Dieses Feld wird ausgefüllt, wenn der Nutzer die Auswertung für die aktuelle Version oder den aktuellen Entwurf ausführt. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
executionState |
Nur Ausgabe. Der Status der Ausführung des Bewertungsergebnisses. |
evaluationMetricsThresholds |
Nur Ausgabe. Die Auswertungsschwellen für das Ergebnis. |
config |
Nur Ausgabe. Die Konfiguration, die im Auswertungsdurchlauf verwendet wurde, der zu diesem Ergebnis geführt hat. |
goldenRunMethod |
Nur Ausgabe. Die Methode, mit der die Golden-Bewertung durchgeführt wurde. |
rootSpan |
Nur Ausgabe. Der Stamm-Span der Ausführung der Auswertung, der Informationen zu jedem Schritt der Auswertung enthält. |
outcomeMetadata |
Nur Ausgabe. Die Ergebnis-Metadaten der Bewertung. Wird nur ausgefüllt, wenn „execution_state“ COMPLETE ist. |
Union-Feld result. Das Ergebnis der Bewertung. Wird nur ausgefüllt, wenn der execution_state COMPLETED ist. Für result ist nur einer der folgenden Werte zulässig: |
|
goldenResult |
Nur Ausgabe. Das Ergebnis einer Golden-Evaluierung. |
scenarioResult |
Nur Ausgabe. Das Ergebnis einer Szenariobewertung. |
GoldenResult
| JSON-Darstellung |
|---|
{ "turnReplayResults": [ { object ( |
| Felder | |
|---|---|
turnReplayResults[] |
Nur Ausgabe. Das Ergebnis der Ausführung jeder Runde der Golden-Unterhaltung. |
evaluationExpectationResults[] |
Nur Ausgabe. Die Ergebnisse der erwarteten Auswertung. |
TurnReplayResult
| JSON-Darstellung |
|---|
{ "conversation": string, "expectationOutcome": [ { object ( |
| Felder | |
|---|---|
conversation |
Nur Ausgabe. Die Unterhaltung, die für diesen Zug generiert wurde. |
expectationOutcome[] |
Nur Ausgabe. Das Ergebnis jeder Erwartung. |
hallucinationResult |
Nur Ausgabe. Das Ergebnis der Halluzinationsprüfung. |
toolInvocationScore |
Nur Ausgabe. Verworfen Verwenden Sie stattdessen „OverallToolInvocationResult“. |
turnLatency |
Nur Ausgabe. Dauer des Zugs. Die Dauer in Sekunden mit bis zu neun Nachkommastellen und am Ende mit „ |
toolCallLatencies[] |
Nur Ausgabe. Die Latenz jedes Tool-Aufrufs in der Runde. |
semanticSimilarityResult |
Nur Ausgabe. Das Ergebnis der Prüfung der semantischen Ähnlichkeit. |
overallToolInvocationResult |
Nur Ausgabe. Das Ergebnis der Prüfung des gesamten Tool-Aufrufs. |
errorInfo |
Nur Ausgabe. Informationen zum Fehler, der während dieses Zuges aufgetreten ist. |
spanLatencies[] |
Nur Ausgabe. Die Latenz von Spans im Turn. |
Union-Feld Für |
|
toolOrderedInvocationScore |
Nur Ausgabe. Die Gesamtbewertung für den Toolaufruf für diesen Zug. Dies gibt den Gesamtprozentsatz der Tools an, die im erwarteten Zug tatsächlich in der erwarteten Reihenfolge aufgerufen wurden. |
GoldenExpectationOutcome
| JSON-Darstellung |
|---|
{ "expectation": { object ( |
| Felder | |
|---|---|
expectation |
Nur Ausgabe. Die Erwartung, die ausgewertet wurde. |
outcome |
Nur Ausgabe. Das Ergebnis der Erwartung. |
semanticSimilarityResult |
Nur Ausgabe. Das Ergebnis der Prüfung der semantischen Ähnlichkeit. |
toolInvocationResult |
Nur Ausgabe. Das Ergebnis der Überprüfung des Tool-Aufrufs. |
Union-Feld result. Das Ergebnis der Erwartung. Für result ist nur einer der folgenden Werte zulässig: |
|
observedToolCall |
Nur Ausgabe. Das Ergebnis der Erwartung des Tool-Aufrufs. |
observedToolResponse |
Nur Ausgabe. Das Ergebnis der Erwartung der Tool-Antwort. |
observedAgentResponse |
Nur Ausgabe. Das Ergebnis der Erwartung der Agentenantwort. |
observedAgentTransfer |
Nur Ausgabe. Das Ergebnis der Erwartung der Agentenübertragung. |
observedPayload |
Nur Ausgabe. Eine beobachtete benutzerdefinierte Nutzlast. Für benutzerdefinierte Nutzlasten gibt es keine Erwartungen. Dieser Wert wird nur für die Berechnung von Messwerten verwendet. Das Ergebnis ist immer SKIPPED. |
SemanticSimilarityResult
| JSON-Darstellung |
|---|
{ "label": string, "explanation": string, "outcome": enum ( |
| Felder | |
|---|---|
label |
Nur Ausgabe. Das Label, das mit jeder Punktzahl verknüpft ist. Punktzahl 4: Vollständig konsistent Punktzahl 3: Weitgehend konsistent Punktzahl 2: Teilweise konsistent (geringfügige Auslassungen) Punktzahl 1: Weitgehend inkonsistent (erhebliche Auslassungen) Punktzahl 0: Völlig inkonsistent / widersprüchlich |
explanation |
Nur Ausgabe. Die Erklärung für den Wert für die semantische Ähnlichkeit. |
outcome |
Nur Ausgabe. Das Ergebnis der Prüfung der semantischen Ähnlichkeit. Dies wird durch den Vergleich des Werts mit dem semantic_similarity_success_threshold bestimmt. Wenn der Wert gleich oder höher als der Schwellenwert ist, lautet das Ergebnis „BESTANDEN“. Andernfalls lautet das Ergebnis FAIL. |
Union-Feld Für |
|
score |
Nur Ausgabe. Der semantische Ähnlichkeitswert. Kann 0, 1, 2, 3 oder 4 sein. |
ToolInvocationResult
| JSON-Darstellung |
|---|
{ "outcome": enum ( |
| Felder | |
|---|---|
outcome |
Nur Ausgabe. Das Ergebnis der Überprüfung des Tool-Aufrufs. Dies wird durch den Vergleich des parameter_correctness_score mit dem Schwellenwert bestimmt. Wenn der Wert gleich oder höher als der Schwellenwert ist, lautet das Ergebnis „BESTANDEN“. Andernfalls lautet das Ergebnis FAIL. |
explanation |
Nur Ausgabe. Eine Freitext-Erklärung für das Ergebnis des Tool-Aufrufs. |
Union-Feld Für |
|
parameterCorrectnessScore |
Nur Ausgabe. Die Korrektheitsquote für den Parameter für den Toolaufruf. Dies gibt den Prozentsatz der Parameter aus dem erwarteten Tool-Aufruf an, die auch im tatsächlichen Tool-Aufruf vorhanden waren. |
HallucinationResult
| JSON-Darstellung |
|---|
{ "label": string, "explanation": string, // Union field |
| Felder | |
|---|---|
label |
Nur Ausgabe. Das Label, das mit jeder Punktzahl verknüpft ist. Punktzahl 1: Berechtigte Punktzahl 0: Nicht berechtigte Punktzahl –1: Kein Anspruch zur Bewertung |
explanation |
Nur Ausgabe. Die Erklärung für den Halluzinationswert. |
Union-Feld Für |
|
score |
Nur Ausgabe. Der Halluzinationswert. Kann -1, 0 oder 1 sein. |
ToolCallLatency
| JSON-Darstellung |
|---|
{ "tool": string, "displayName": string, "startTime": string, "endTime": string, "executionLatency": string } |
| Felder | |
|---|---|
tool |
Nur Ausgabe. Der Name des ausgeführten Tools. Format: |
displayName |
Nur Ausgabe. Der Anzeigename des Tools |
startTime |
Nur Ausgabe. Der Beginn der Ausführung des Toolaufrufs. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
endTime |
Nur Ausgabe. Die Endzeit der Ausführung des Tool-Aufrufs. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
executionLatency |
Nur Ausgabe. Die Latenz der Toolaufrufausführung. Die Dauer in Sekunden mit bis zu neun Nachkommastellen und am Ende mit „ |
OverallToolInvocationResult
| JSON-Darstellung |
|---|
{ "outcome": enum ( |
| Felder | |
|---|---|
outcome |
Nur Ausgabe. Das Ergebnis der Überprüfung des Tool-Aufrufs. Dies wird durch den Vergleich des tool_invocation_score mit dem overall_tool_invocation_correctness_threshold bestimmt. Wenn der Wert gleich oder höher als der Schwellenwert ist, lautet das Ergebnis „BESTANDEN“. Andernfalls lautet das Ergebnis FAIL. |
Union-Feld Für |
|
toolInvocationScore |
Die Gesamtbewertung für den Toolaufruf für diesen Turn. Dies ist der Gesamtprozentsatz der Tools aus dem erwarteten Zug, die tatsächlich aufgerufen wurden. |
EvaluationErrorInfo
| JSON-Darstellung |
|---|
{
"errorType": enum ( |
| Felder | |
|---|---|
errorType |
Nur Ausgabe. Die Art des Fehlers. |
errorMessage |
Nur Ausgabe. Die Fehlermeldung. |
sessionId |
Nur Ausgabe. Die Sitzungs-ID für die Unterhaltung, die den Fehler verursacht hat. |
userFacingErrorMessage |
Nur Ausgabe. Die an den Nutzer gerichtete Fehlermeldung. |
SpanLatency
| JSON-Darstellung |
|---|
{ "type": enum ( |
| Felder | |
|---|---|
type |
Nur Ausgabe. Der Typ des Zeitraums. |
displayName |
Nur Ausgabe. Der Anzeigename des Zeitraums. Gilt für Tool- und Schutzmaßnahmenbereiche. |
startTime |
Nur Ausgabe. Die Startzeit des Zeitraums. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
endTime |
Nur Ausgabe. Die Endzeit des Zeitraums. Verwendet RFC 3339, wobei die generierte Ausgabe immer Z-normalisiert ist und 0, 3, 6 oder 9 Nachkommastellen verwendet. Andere Offsets als „Z“ werden ebenfalls akzeptiert. Beispiele: |
executionLatency |
Nur Ausgabe. Die Latenz des Spans. Die Dauer in Sekunden mit bis zu neun Nachkommastellen und am Ende mit „ |
Union-Feld identifier. Die Kennzeichnung des jeweiligen Artikels basierend auf seinem Typ. Für identifier ist nur einer der folgenden Werte zulässig: |
|
resource |
Nur Ausgabe. Der Ressourcenname der Spannen für die Schutzvorrichtung oder das Tool. |
toolset |
Nur Ausgabe. Die Tool-ID des Toolsets. |
model |
Nur Ausgabe. Der Name des LLM-Spans. |
callback |
Nur Ausgabe. Der Name des Zeitraums für den Nutzer-Callback. |
EvaluationExpectationResult
| JSON-Darstellung |
|---|
{
"evaluationExpectation": string,
"prompt": string,
"outcome": enum ( |
| Felder | |
|---|---|
evaluationExpectation |
Nur Ausgabe. Die Erwartung an die Bewertung. Format: |
prompt |
Nur Ausgabe. Der Prompt, der für die Auswertung verwendet wurde. |
outcome |
Nur Ausgabe. Das Ergebnis der Erwartung der Auswertung. |
explanation |
Nur Ausgabe. Die Erklärung für das Ergebnis. |
ScenarioResult
| JSON-Darstellung |
|---|
{ "conversation": string, "task": string, "userFacts": [ { object ( |
| Felder | |
|---|---|
conversation |
Nur Ausgabe. Die im Szenario generierte Unterhaltung. |
task |
Nur Ausgabe. Die Aufgabe, die beim Ausführen des Szenarios für dieses Ergebnis verwendet wurde. |
userFacts[] |
Nur Ausgabe. Die Nutzerinformationen, die vom Szenario für dieses Ergebnis verwendet wurden. |
expectationOutcomes[] |
Nur Ausgabe. Das Ergebnis jeder Erwartung. |
rubricOutcomes[] |
Nur Ausgabe. Das Ergebnis des Bewertungsschemas. |
hallucinationResult[] |
Nur Ausgabe. Das Ergebnis der Halluzinationsprüfung. Für jede Runde in der Unterhaltung wird ein Halluzinationsergebnis angezeigt. |
taskCompletionResult |
Nur Ausgabe. Das Ergebnis der Überprüfung des Aufgabenabschlusses. |
toolCallLatencies[] |
Nur Ausgabe. Die Latenz der Ausführung jedes Tool-Aufrufs in der Unterhaltung. |
userGoalSatisfactionResult |
Nur Ausgabe. Das Ergebnis der Prüfung der Nutzerzielerreichung. |
spanLatencies[] |
Nur Ausgabe. Die Latenz von Spans in der Unterhaltung. |
evaluationExpectationResults[] |
Nur Ausgabe. Die Ergebnisse der erwarteten Auswertung. |
Union-Feld Für |
|
allExpectationsSatisfied |
Nur Ausgabe. Gibt an, ob alle Erwartungen für diesen Zug erfüllt wurden. |
Union-Feld Für |
|
taskCompleted |
Nur Ausgabe. Gibt an, ob die Aufgabe in dieser Runde erledigt wurde. Dies ist eine Kombination aus allen erfüllten Erwartungen, keinen Halluzinationen und der Erfüllung des Nutzerziels. |
ScenarioExpectationOutcome
| JSON-Darstellung |
|---|
{ "expectation": { object ( |
| Felder | |
|---|---|
expectation |
Nur Ausgabe. Die Erwartung, die ausgewertet wurde. |
outcome |
Nur Ausgabe. Das Ergebnis der ScenarioExpectation. |
Union-Feld result. Das Ergebnis der Erwartung. Für result ist nur einer der folgenden Werte zulässig: |
|
observedToolCall |
Nur Ausgabe. Der beobachtete Toolaufruf. |
observedAgentResponse |
Nur Ausgabe. Die beobachtete Antwort des KI-Agenten. |
ObservedToolCall
| JSON-Darstellung |
|---|
{ "toolCall": { object ( |
| Felder | |
|---|---|
toolCall |
Nur Ausgabe. Der beobachtete Toolaufruf. |
toolResponse |
Nur Ausgabe. Die beobachtete Tool-Antwort. |
ScenarioRubricOutcome
| JSON-Darstellung |
|---|
{ "rubric": string, "scoreExplanation": string, // Union field |
| Felder | |
|---|---|
rubric |
Nur Ausgabe. Das Bewertungsschema, das zur Bewertung der Unterhaltung verwendet wurde. |
scoreExplanation |
Nur Ausgabe. Die Antwort des Bewerters auf das Bewertungsschema. |
Union-Feld Für |
|
score |
Nur Ausgabe. Die Bewertung der Unterhaltung anhand der Rubrik. |
TaskCompletionResult
| JSON-Darstellung |
|---|
{ "label": string, "explanation": string, // Union field |
| Felder | |
|---|---|
label |
Nur Ausgabe. Das Label, das mit jeder Punktzahl verknüpft ist. Punktzahl 1: Aufgabe erledigt Punktzahl 0: Aufgabe nicht erledigt Punktzahl –1: Nutzerziel nicht definiert |
explanation |
Nur Ausgabe. Die Erklärung für den Wert für die Aufgabenerledigung. |
Union-Feld Für |
|
score |
Nur Ausgabe. Die Punktzahl für die Erledigung der Aufgabe. Kann -1, 0 oder 1 sein |
UserGoalSatisfactionResult
| JSON-Darstellung |
|---|
{ "label": string, "explanation": string, // Union field |
| Felder | |
|---|---|
label |
Nur Ausgabe. Das Label, das mit jeder Punktzahl verknüpft ist. Wert 2: Graceful Handoff Score 1: User Task Satisfied Score 0: User Task Not Satisfied Score –1: User Task Unspecified |
explanation |
Nur Ausgabe. Die Erklärung für den Messwert zur Zufriedenheit mit der Nutzeraufgabe. |
Union-Feld Für |
|
score |
Nur Ausgabe. Der Zufriedenheitswert für die Nutzeraufgabe. Kann -1, 0, 1 oder 2 sein. |
EvaluationPersona
| JSON-Darstellung |
|---|
{
"name": string,
"description": string,
"displayName": string,
"personality": string,
"speechConfig": {
object ( |
| Felder | |
|---|---|
name |
Erforderlich. Die eindeutige ID der Persona. Format: |
description |
Optional. Die Beschreibung der Persona. |
displayName |
Erforderlich. Der Anzeigename der Persona. Innerhalb einer App eindeutig. |
personality |
Erforderlich. Eine Anweisung für den KI-Agenten, wie er sich bei der Bewertung verhalten soll. |
speechConfig |
Optional. Konfiguration für die Stimme der Persona (TTS-Einstellungen). |
SpeechConfig
| JSON-Darstellung |
|---|
{
"speakingRate": number,
"environment": enum ( |
| Felder | |
|---|---|
speakingRate |
Optional. Die Sprechgeschwindigkeit. 1,0 ist normal. Niedrigere Werte sind langsamer (z. B. 0,8), höhere Werte sind schneller (z. B. 1,5). Nützlich, um zu testen, wie der Agent mit schnellen Sprechern umgeht. |
environment |
Optional. Die simulierte Audio-Umgebung. |
voiceId |
Optional. Die spezifische Sprach-ID/der spezifische Akzent, der verwendet werden soll. Beispiel: „en-US-Wavenet-D“ oder „en-GB-Standard-A“ |
Status
| JSON-Darstellung |
|---|
{ "code": integer, "message": string, "details": [ { "@type": string, field1: ..., ... } ] } |
| Felder | |
|---|---|
code |
Der Statuscode, der idealerweise ein ENUM-Wert von |
message |
Eine an Entwickler gerichtete Fehlermeldung, die englischsprachig sein sollte. Jede für Nutzer sichtbare Fehlermeldung sollte lokalisiert und im Feld |
details[] |
Eine Auflistung aller Meldungen, die die Fehlerdetails enthalten. Es gibt einen gemeinsamen Satz von Nachrichtentypen, die APIs verwenden können. Ein Objekt, das Felder eines beliebigen Typs enthält. Ein zusätzliches Feld |
Beliebig
| JSON-Darstellung |
|---|
{ "typeUrl": string, "value": string } |
| Felder | |
|---|---|
typeUrl |
Gibt den Typ der serialisierten Protobuf-Nachricht mit einem URI-Verweis an, der aus einem Präfix, das mit einem Schrägstrich endet, und dem vollständig qualifizierten Typnamen besteht. Beispiel: type.googleapis.com/google.protobuf.StringValue Dieser String muss mindestens ein Das Präfix ist beliebig. Protobuf-Implementierungen entfernen einfach alles bis zum letzten Alle Typ-URL-Strings müssen gültige URI-Referenzen sein. Für das Textformat gilt die zusätzliche Einschränkung, dass der Inhalt der Referenz nur aus alphanumerischen Zeichen, prozentual codierten Escape-Sequenzen und Zeichen aus der folgenden Menge bestehen darf (ohne die äußeren Backticks): Im ursprünglichen Design von |
value |
Enthält eine Protobuf-Serialisierung des Typs, der durch „type_url“ beschrieben wird. Ein base64-codierter String. |
EvaluationMetricsThresholds
| JSON-Darstellung |
|---|
{ "goldenEvaluationMetricsThresholds": { object ( |
| Felder | |
|---|---|
goldenEvaluationMetricsThresholds |
Optional. Die Grenzwerte für die Golden-Bewertungsmesswerte. |
hallucinationMetricBehavior |
Optional. Nicht mehr unterstützt: Verwenden Sie stattdessen |
goldenHallucinationMetricBehavior |
Optional. Das Verhalten des Messwerts für Halluzinationen bei Golden Evaluations. |
scenarioHallucinationMetricBehavior |
Optional. Das Verhalten des Halluzinationsmesswerts für Szenariobewertungen. |
GoldenEvaluationMetricsThresholds
| JSON-Darstellung |
|---|
{ "turnLevelMetricsThresholds": { object ( |
| Felder | |
|---|---|
turnLevelMetricsThresholds |
Optional. Die Schwellenwerte für Messwerte auf Turn-Ebene. |
expectationLevelMetricsThresholds |
Optional. Die Grenzwerte für die Messwerte für das Erwartungsniveau. |
toolMatchingSettings |
Optional. Die Einstellungen für den Tool-Abgleich. Ein zusätzlicher Tool-Aufruf ist ein Tool-Aufruf, der in der Ausführung vorhanden ist, aber keinem Tool-Aufruf in der Goldenen Erwartung entspricht. |
ToolMatchingSettings
| JSON-Darstellung |
|---|
{
"extraToolCallBehavior": enum ( |
| Felder | |
|---|---|
extraToolCallBehavior |
Optional. Verhalten bei zusätzlichen Tool-Aufrufen. Die Standardeinstellung ist FAIL. |
EvaluationConfig
| JSON-Darstellung |
|---|
{ "inputAudioConfig": { object ( |
| Felder | |
|---|---|
inputAudioConfig |
Optional. Konfiguration für die Verarbeitung des Audioeingabe. |
outputAudioConfig |
Optional. Konfiguration zum Generieren der Audioausgabe. |
evaluationChannel |
Optional. Der auszuwertende Channel. |
toolCallBehaviour |
Optional. Gibt an, ob bei der Auswertung echte Tool-Aufrufe oder gefälschte Tools verwendet werden sollen. |
InputAudioConfig
| JSON-Darstellung |
|---|
{
"audioEncoding": enum ( |
| Felder | |
|---|---|
audioEncoding |
Erforderlich. Die Codierung der Audioeingabedaten. |
sampleRateHertz |
Erforderlich. Die Abtastrate (in Hertz) der Audioeingabedaten. |
noiseSuppressionLevel |
Optional. Gibt an, ob die Rauschunterdrückung für das eingegebene Audio aktiviert werden soll. Verfügbare Werte sind „low“, „moderate“, „high“ und „very_high“. |
OutputAudioConfig
| JSON-Darstellung |
|---|
{
"audioEncoding": enum ( |
| Felder | |
|---|---|
audioEncoding |
Erforderlich. Die Codierung der Audioausgabedaten. |
sampleRateHertz |
Erforderlich. Die Abtastrate (in Hertz) der Audioausgabedaten. |
EvaluationMetricsConfig
| JSON-Darstellung |
|---|
{ "goldenMetricsConfig": { object ( |
| Felder | |
|---|---|
goldenMetricsConfig |
Optional. Konfiguration für die wichtigsten Messwerte für die Bewertung. |
scenarioMetricsConfig |
Optional. Konfiguration für die Szenariomesswerte für die Auswertung. |
GoldenMetricsConfig
| JSON-Darstellung |
|---|
{ "semanticSimilarityMetricsConfig": { object ( |
| Felder | |
|---|---|
semanticSimilarityMetricsConfig |
Optional. Globale Konfiguration für Messwerte zur semantischen Ähnlichkeit. |
toolCorrectnessMetricsConfig |
Optional. Konfiguration für Messwerte zur Richtigkeit des Tools auf Turn-Ebene. |
stepToolCorrectnessMetricsConfig |
Optional. Konfiguration für Messwerte zur Richtigkeit von Tools auf Schrittebene. |
ToolCorrectnessMetricsConfig
| JSON-Darstellung |
|---|
{ "enableToolCorrectnessMetrics": boolean } |
| Felder | |
|---|---|
enableToolCorrectnessMetrics |
Optional. Gibt an, ob Messwerte für die Richtigkeit von Tools für die Bewertung berechnet werden sollen. |
ScenarioMetricsConfig
| JSON-Darstellung |
|---|
{ "userGoalMetMetricsConfig": { object ( |
| Felder | |
|---|---|
userGoalMetMetricsConfig |
Optional. Konfiguration für Messwerte für erreichte Nutzerziele. |
expectationsMetMetricsConfig |
Optional. Konfiguration für Messwerte auf Erwartungsebene. |
UserGoalMetMetricsConfig
| JSON-Darstellung |
|---|
{ "enableUserGoalMetMetrics": boolean } |
| Felder | |
|---|---|
enableUserGoalMetMetrics |
Optional. Gibt an, ob die Messwerte für das erreichte Nutzerziel für die Auswertung berechnet werden sollen. |
ExpectationsMetMetricsConfig
| JSON-Darstellung |
|---|
{ "enableExpectationsMetMetrics": boolean } |
| Felder | |
|---|---|
enableExpectationsMetMetrics |
Optional. Gibt an, ob die Messwerte für das Erwartungsniveau für die Auswertung berechnet werden sollen. |
NullValue
Stellt ein JSON-null dar.
NullValue ist ein Sentinel, der einen Enum mit nur einem Wert verwendet, um den Nullwert für die Typunion Value darzustellen.
Ein Feld vom Typ NullValue mit einem anderen Wert als 0 gilt als ungültig. Die meisten ProtoJSON-Serialisierungsprogramme geben ein Value mit einem als JSON-null festgelegten null_value aus, unabhängig vom Ganzzahlwert. Daher wird ein Roundtrip zu einem 0-Wert durchgeführt.
| Enums | |
|---|---|
NULL_VALUE |
Nullwert. |
ComparisonType
Unterstützte Vergleichstypen zum Prüfen der Antwort des Kundenservicemitarbeiters.
| Enums | |
|---|---|
COMPARISON_TYPE_UNSPECIFIED |
Nicht angegebener Vergleichstyp. Das Standardverhalten für Agent-Antworten und Tool-Aufrufe ist SEMANTIC_SIMILARITY. |
EQUALS |
Exakte Stringübereinstimmung. |
CONTAINS |
Teilstring-Abgleich: Prüft, ob der erwartete String in der tatsächlichen Antwort enthalten ist. |
SEMANTIC_SIMILARITY |
Abgleich der semantischen Ähnlichkeit (bewertet die Bedeutungsähnlichkeit mithilfe eines LLM). |
SemanticSimilarityChannel
Der zu verwendende Channel für die semantische Ähnlichkeit.
| Enums | |
|---|---|
SEMANTIC_SIMILARITY_CHANNEL_UNSPECIFIED |
Messwert nicht angegeben. Die Standardeinstellung ist TEXT. |
TEXT |
Semantische Ähnlichkeit von Text verwenden. |
AUDIO |
Semantische Ähnlichkeit von Audioinhalten verwenden. |
HallucinationMetricBehavior
Das Verhalten des Messwerts für Halluzinationen. Der Messwert wird immer berechnet, unabhängig vom Verhalten. Der Unterschied besteht darin, dass der Messwert bei Deaktivierung nicht zur Berechnung der Gesamtbewertung verwendet wird.
| Enums | |
|---|---|
HALLUCINATION_METRIC_BEHAVIOR_UNSPECIFIED |
Nicht angegebenes Verhalten des Halluzinationsmesswerts. |
DISABLED |
Messwert für Halluzinationen deaktivieren. |
ENABLED |
Halluzinationsmesswert aktivieren |
TaskCompletionBehavior
Das erwartete Verhalten der Nutzeraufgabe. Damit wird ermittelt, ob das Szenario erfolgreich ist.
| Enums | |
|---|---|
TASK_COMPLETION_BEHAVIOR_UNSPECIFIED |
Verhalten nicht angegeben. Wird standardmäßig auf TASK_SATISFIED gesetzt. |
TASK_SATISFIED |
Die Nutzeraufgabe sollte erfolgreich abgeschlossen werden. |
TASK_REJECTED |
Die Nutzeraufgabe sollte abgelehnt werden. |
UserGoalBehavior
Das erwartete Verhalten des Nutzerziels. Damit wird ermittelt, ob das Szenario erfolgreich ist.
| Enums | |
|---|---|
USER_GOAL_BEHAVIOR_UNSPECIFIED |
Verhalten nicht angegeben. Die Standardeinstellung ist USER_GOAL_SATISFIED. |
USER_GOAL_SATISFIED |
Das Nutzerziel sollte erfolgreich erreicht werden. |
USER_GOAL_REJECTED |
Das Nutzerziel sollte abgelehnt werden. |
USER_GOAL_IGNORED |
Ignorieren Sie den Status des Nutzerziels. |
ScenarioExecutionMode
Der Ausführungsmodus für Szenariobewertungen.
| Enums | |
|---|---|
SCENARIO_EXECUTION_MODE_UNSPECIFIED |
Nicht angegebener Ausführungsmodus. Die Standardeinstellung ist QUALITY_OPTIMIZED. |
QUALITY_OPTIMIZED |
Modus für Qualitätsoptimierung. |
SPEED_OPTIMIZED |
Für Geschwindigkeit optimierter Modus. |
Ergebnis
Das Ergebnis der Bewertung oder Erwartung.
| Enums | |
|---|---|
OUTCOME_UNSPECIFIED |
Das Ergebnis der Bewertung wird nicht angegeben. |
PASS |
Bewertung/Erwartung erfüllt. Im Fall einer Bewertung bedeutet dies, dass alle Erwartungen erfüllt wurden. |
FAIL |
Bewertung/Erwartung fehlgeschlagen. Im Falle einer Bewertung bedeutet dies, dass mindestens eine Erwartung nicht erfüllt wurde. |
SKIPPED |
Die Bewertung/Erwartung wurde übersprungen. |
ErrorType
Art des Fehlers
| Enums | |
|---|---|
ERROR_TYPE_UNSPECIFIED |
Nicht angegebener Fehlertyp. |
RUNTIME_FAILURE |
Fehler während der Laufzeitausführung. |
CONVERSATION_RETRIEVAL_FAILURE |
Die Unterhaltung konnte nicht aus der CES-Laufzeit abgerufen werden. |
METRIC_CALCULATION_FAILURE |
Ein Messwert oder Ergebnis konnte nicht berechnet werden. |
EVALUATION_UPDATE_FAILURE |
Die Bewertung konnte nicht aktualisiert werden. |
QUOTA_EXHAUSTED |
Kontingent aufgebraucht. |
USER_SIMULATION_FAILURE |
Fehler bei der Nutzersimulation. |
Typ
Der Typ des Zeitraums. In Zukunft werden möglicherweise weitere Werte hinzugefügt.
| Enums | |
|---|---|
TYPE_UNSPECIFIED |
Standardwert. Dieser Wert wird nicht verwendet. |
TOOL |
Toolaufruf-Spanne. |
USER_CALLBACK |
Zeitspanne für den Rückruf des Nutzers. |
GUARDRAIL |
Zeitspanne für Schutzmaßnahmen |
LLM |
LLM-Spanne. |
BackgroundEnvironment
Simulierte Audio-Umgebung.
| Enums | |
|---|---|
BACKGROUND_ENVIRONMENT_UNSPECIFIED |
Die Hintergrundumgebung ist nicht angegeben. |
CALL_CENTER |
Callcenter-Umgebung. |
TRAFFIC |
Umgebung mit Straßenverkehrslärm. |
KIDS_NOISE |
Geräuschumgebung für Kinder. |
CAFE |
Café-Umgebung. |
ExecutionState
Der Status der Ausführung des Bewertungsergebnisses.
| Enums | |
|---|---|
EXECUTION_STATE_UNSPECIFIED |
Der Ausführungsstatus des Bewertungsergebnisses ist nicht angegeben. |
QUEUED |
Die Ausführung des Bewertungsergebnisses ist in der Warteschlange. |
RUNNING |
Die Ausführung des Bewertungsergebnisses läuft. |
COMPLETED |
Die Ausführung des Bewertungsergebnisses ist abgeschlossen. |
ERROR |
Die Ausführung des Bewertungsergebnisses ist aufgrund eines internen Fehlers fehlgeschlagen. |
CANCELLED |
Die Ausführung des Bewertungsergebnisses wurde abgebrochen. |
ExtraToolCallBehavior
Definiert das Verhalten, wenn ein zusätzlicher Tool-Aufruf erfolgt. Ein zusätzlicher Tool-Aufruf ist ein Tool-Aufruf, der in der Ausführung vorhanden ist, aber keinem Tool-Aufruf in der Goldenen Erwartung entspricht.
| Enums | |
|---|---|
EXTRA_TOOL_CALL_BEHAVIOR_UNSPECIFIED |
Nicht angegebenes Verhalten. Die Standardeinstellung ist FAIL. |
FAIL |
Die Auswertung schlägt fehl, wenn ein zusätzlicher Toolaufruf erfolgt. |
ALLOW |
Zusätzlichen Toolaufruf zulassen |
AudioEncoding
AudioEncoding gibt das Codierungsformat für Audiodaten an.
| Enums | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Nicht angegebene Audiocodierung. |
LINEAR16 |
16-Bit-Codierung mit linearer PCM-Audio (Pulse-code Modulation, Pulscodemodulation) |
MULAW |
8-Bit-Samples zur Kompandierung von 14-Bit-Audiosamples mit G.711 PCMU/mu-law. |
ALAW |
8-Bit-Samples zur Kompandierung von 14-Bit-Audiosamples mit G.711 PCMU/A-law. |
EvaluationChannel
Der auszuwertende Channel.
| Enums | |
|---|---|
EVALUATION_CHANNEL_UNSPECIFIED |
Nicht angegebener Bewertungskanal. |
TEXT |
Kanal für die reine Textbewertung. |
AUDIO |
Audiokanal für die Bewertung. |
EvaluationToolCallBehaviour
Konfiguriert das Verhalten von Tool-Aufrufen für Auswertungen.
| Enums | |
|---|---|
EVALUATION_TOOL_CALL_BEHAVIOUR_UNSPECIFIED |
Nicht angegebenes Verhalten bei Tool-Aufrufen. Standardmäßig werden echte Tool-Aufrufe verwendet. |
REAL |
Verwenden Sie echte Tool-Aufrufe. |
FAKE |
Falsche Tool-Aufrufe verwenden |
GoldenRunMethod
Die Methode, mit der die Bewertung durchgeführt wurde.
| Enums | |
|---|---|
GOLDEN_RUN_METHOD_UNSPECIFIED |
Die Ausführungsmethode ist nicht angegeben. |
STABLE |
Führen Sie die Bewertung als stabilen Replay aus, bei dem jeder Zug eine eindeutige Sitzung ist, in die die vorherigen erwarteten Züge als Kontext eingefügt werden. |
NAIVE |
Führen Sie die Auswertung als naives Replay aus. Dabei ist der Lauf eine einzelne Sitzung ohne eingefügten Kontext. |
OutcomeMetadata
Metadaten zum Ergebnis der Bewertung.
| Enums | |
|---|---|
OUTCOME_METADATA_UNSPECIFIED |
Nicht angegebene Metadaten für das Ergebnis. |
GRACEFUL_HANDOFF |
Die Evaluierung führte zu einer reibungslosen Übergabe an einen Kundenservicemitarbeiter. |
Tool-Annotationen
Tool-Anmerkungen werden an MCP-Clients gesendet, um das grundlegende Risiko eines bestimmten Tools zu beschreiben. Die meisten Clients behandeln diese Hinweise als nicht vertrauenswürdig, sie können aber verwendet werden, um zu entscheiden, wann eine Bestätigungsaufforderung an einen Nutzer gesendet wird.
Zusammen mit dem Titelstring sind die folgenden booleschen Hinweise definiert:
readOnlyHint: Wenn „true“, ändert das Tool seine Umgebung nicht. Standardeinstellung: false.destructiveHint: Wenn „true“, kann das Tool destruktive Aktionen ausführen. Wenn „false“, kann das Tool nur additive Aktionen ausführen. Standardeinstellung: true.idempotentHint: Wenn „true“, hat das wiederholte Aufrufen des Tools mit denselben Argumenten keine zusätzlichen Auswirkungen auf die Umgebung. Standardeinstellung: false.openWorldHint: Wenn „true“, kann das Tool mit einer „offenen Welt“ externer Einheiten interagieren. Wenn „false“, kann das Tool nur mit internen Einheiten interagieren. Ein Web-Suchtool wäre beispielsweise frei verfügbar, ein Memory-Tool jedoch nicht.
Destructive Hint: ❌ | Idempotent Hint: ✅ | Read Only Hint: ✅ | Open World Hint: ❌