Outil : create_evaluation
Crée une évaluation.
L'exemple de code suivant montre comment utiliser curl pour appeler l'outil MCP create_evaluation.
| Requête curl |
|---|
curl --location 'https://ces.googleapis.com/mcp' \ --header 'content-type: application/json' \ --header 'accept: application/json, text/event-stream' \ --data '{ "method": "tools/call", "params": { "name": "create_evaluation", "arguments": { // provide these details according to the tool's MCP specification } }, "jsonrpc": "2.0", "id": 1 }' |
Schéma d'entrée
Message de requête pour EvaluationService.CreateEvaluation.
CreateEvaluationRequest
| Représentation JSON |
|---|
{
"parent": string,
"evaluationId": string,
"evaluation": {
object ( |
| Champs | |
|---|---|
parent |
Obligatoire. Application pour laquelle créer l'évaluation. Format : |
evaluationId |
Facultatif. ID à utiliser pour l'évaluation, qui constituera le composant final du nom de ressource de l'évaluation. Si aucun ID n'est fourni, un ID unique est attribué automatiquement à l'évaluation. |
evaluation |
Obligatoire. Évaluation à créer. |
Évaluation
| Représentation JSON |
|---|
{ "name": string, "displayName": string, "description": string, "tags": [ string ], "evaluationDatasets": [ string ], "createTime": string, "createdBy": string, "updateTime": string, "lastUpdatedBy": string, "evaluationRuns": [ string ], "etag": string, "aggregatedMetrics": { object ( |
| Champs | |
|---|---|
name |
Identifiant. Identifiant unique de cette évaluation. Format : |
displayName |
Obligatoire. Nom à afficher de l'évaluation défini par l'utilisateur. Unique dans une application. |
description |
Facultatif. Description de l'évaluation définie par l'utilisateur. |
tags[] |
Facultatif. Tags définis par l'utilisateur pour catégoriser l'évaluation. |
evaluationDatasets[] |
Uniquement en sortie. Liste des ensembles de données d'évaluation auxquels appartient l'évaluation. Format : |
createTime |
Uniquement en sortie. Horodatage de la création de l'évaluation. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
createdBy |
Uniquement en sortie. Utilisateur qui a créé l'évaluation. |
updateTime |
Uniquement en sortie. Code temporel de la dernière mise à jour de l'évaluation. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
lastUpdatedBy |
Uniquement en sortie. L'utilisateur qui a mis à jour l'évaluation pour la dernière fois. |
evaluationRuns[] |
Uniquement en sortie. Les EvaluationRuns auxquels cette évaluation est associée. |
etag |
Uniquement en sortie. Etag utilisé pour s'assurer que l'objet n'a pas été modifié lors d'une opération de lecture/modification/écriture. Si l'etag est vide, la mise à jour écrasera toutes les modifications simultanées. |
aggregatedMetrics |
Uniquement en sortie. Métriques agrégées pour cette évaluation sur toutes les exécutions. |
lastCompletedResult |
Uniquement en sortie. Le dernier résultat de l'évaluation. |
invalid |
Uniquement en sortie. Indique si l'évaluation n'est pas valide. Cela peut se produire si une évaluation fait référence à un outil, un ensemble d'outils ou un agent qui a été supprimé depuis. |
lastTenResults[] |
Uniquement en sortie. Les 10 derniers résultats d'évaluation pour cette évaluation. Cette valeur n'est renseignée que si include_last_ten_results est défini sur "true" dans ListEvaluationsRequest ou GetEvaluationRequest. |
evaluationMetricsThresholdOverride |
Facultatif. Remplace les seuils de métriques pour cette évaluation spécifique. |
evaluationMetricsConfigOverride |
Facultatif. Remplace la configuration des métriques pour cette évaluation spécifique. |
Champ d'union inputs. Les entrées de l'évaluation inputs ne peuvent être que l'une des suivantes : |
|
golden |
Facultatif. Étapes de référence à évaluer. |
scenario |
Facultatif. Configuration d'un scénario. |
Doré
| Représentation JSON |
|---|
{
"turns": [
{
object ( |
| Champs | |
|---|---|
turns[] |
Obligatoire. Nombre de tours en or requis pour rejouer une conversation en or. Le nombre maximal de tours autorisés est de 100. |
evaluationExpectations[] |
Facultatif. Attentes d'évaluation par rapport auxquelles évaluer la conversation rejouée. Format : |
GoldenTurn
| Représentation JSON |
|---|
{ "steps": [ { object ( |
| Champs | |
|---|---|
steps[] |
Obligatoire. Étapes à suivre pour rejouer une conversation de référence. |
rootSpan |
Facultatif. Portée racine du tour d'or pour le traitement et la gestion des informations audio. L'URI de l'audio doit contenir un fichier audio enregistré avec un taux d'échantillonnage de 16 kHz. |
turnLevelMetricsThresholdsOverride |
Facultatif. Remplacements pour les seuils de métriques au niveau du tour. |
hallucinationMetricBehaviorOverride |
Facultatif. Ignorer le comportement de la métrique d'hallucination au niveau du tour. |
Étape
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union step. Étape à suivre. step ne peut être qu'un des éléments suivants : |
|
userInput |
Facultatif. Entrée utilisateur pour la conversation. |
agentTransfer |
Facultatif. transférer la conversation à un autre agent ; |
expectation |
Facultatif. Exécute une attente pour le tour actuel. |
SessionInput
| Représentation JSON |
|---|
{ "willContinue": boolean, // Union field |
| Champs | |
|---|---|
willContinue |
Facultatif. Indicateur permettant de déterminer si le message actuel est un fragment d'une entrée plus grande dans la session de streaming bidirectionnel. Si ce paramètre est défini sur REMARQUE : Ce champ ne s'applique pas aux entrées audio et DTMF, car elles sont toujours traitées automatiquement en fonction du signal de fin. |
Champ d'union input_type. Type d'entrée. input_type ne peut être qu'un des éléments suivants : |
|
text |
Facultatif. Données textuelles de l'utilisateur final. |
dtmf |
Facultatif. Chiffres DTMF de l'utilisateur final. |
audio |
Facultatif. Données audio de l'utilisateur final. Chaîne encodée en base64. |
toolResponses |
Facultatif. Résultats d'exécution des appels d'outils du client. |
image |
Facultatif. Données d'image de l'utilisateur final. |
blob |
Facultatif. Données blob de l'utilisateur final. |
variables |
Facultatif. Variables contextuelles pour la session, identifiées par leur nom. L'agent CES n'utilisera que les variables déclarées dans l'application. Les variables non reconnues seront toujours envoyées à l'[agent Dialogflow][Agent.RemoteDialogflowAgent] en tant que paramètres de session supplémentaires. |
event |
Facultatif. Saisie d'événement. |
ToolResponses
| Représentation JSON |
|---|
{
"toolResponses": [
{
object ( |
| Champs | |
|---|---|
toolResponses[] |
Facultatif. Liste des résultats d'exécution de l'outil. |
ToolResponse
| Représentation JSON |
|---|
{ "id": string, "displayName": string, "response": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Champs | |
|---|---|
id |
Facultatif. ID correspondant du |
displayName |
Uniquement en sortie. Nom à afficher de l'outil. |
response |
Obligatoire. Résultat de l'exécution de l'outil au format d'objet JSON. Utilisez la clé "output" pour spécifier la réponse de l'outil et la clé "error" pour spécifier les détails de l'erreur (le cas échéant). Si les clés "output" et "error" ne sont pas spécifiées, l'ensemble de la "response" est traité comme le résultat de l'exécution de l'outil. |
parentToolCallId |
Uniquement en sortie. ID de l'appel d'outil qui a déclenché celui-ci, lorsqu'il a été émis par un sous-agent travaillant pour le compte d'un appel parent. Vide pour les appels de premier niveau. Permet à un client de regrouper le travail d'un sous-agent sous l'appel qui l'a déclenché au lieu de rendre chaque étape en tant que frère. |
agentName |
Uniquement en sortie. Nom lisible de l'agent qui a émis cet appel, par exemple "Architecte de contrat". Vide lorsque l'agent racine l'a émis. |
Champ d'union tool_identifier. Identifiant de l'outil qui a été exécuté. Il peut s'agir d'un outil persistant ou d'un outil d'un ensemble d'outils. tool_identifier ne peut être qu'un des éléments suivants : |
|
tool |
Facultatif. Nom de l'outil à exécuter. Format : |
toolsetTool |
Facultatif. Outil de l'ensemble d'outils qui a été exécuté. |
ToolsetTool
| Représentation JSON |
|---|
{ "toolset": string, "toolId": string } |
| Champs | |
|---|---|
toolset |
Obligatoire. Nom de ressource de l'ensemble d'outils à partir duquel cet outil est dérivé. Format : |
toolId |
Facultatif. ID de l'outil permettant de filtrer les outils pour récupérer le schéma. |
Struct
| Représentation JSON |
|---|
{ "fields": { string: value, ... } } |
| Champs | |
|---|---|
fields |
Carte non ordonnée de valeurs typées dynamiquement. Objet contenant une liste de paires |
FieldsEntry
| Représentation JSON |
|---|
{ "key": string, "value": value } |
| Champs | |
|---|---|
key |
|
value |
|
Valeur
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union kind. Type de valeur. kind ne peut être qu'un des éléments suivants : |
|
nullValue |
Représente un |
numberValue |
Représente un nombre JSON. Ne doit pas être |
stringValue |
Représente une chaîne JSON. |
boolValue |
Représente une valeur booléenne JSON (littéral |
structValue |
Représente un objet JSON. |
listValue |
Représente un tableau JSON. |
ListValue
| Représentation JSON |
|---|
{ "values": [ value ] } |
| Champs | |
|---|---|
values[] |
Champ répété de valeurs typées de manière dynamique. |
Image
| Représentation JSON |
|---|
{ "mimeType": string, "data": string } |
| Champs | |
|---|---|
mimeType |
Obligatoire. Type MIME standard IANA des données sources. Les types d'images acceptés sont les suivants : * image/png * image/jpeg * image/webp |
data |
Obligatoire. Octets bruts de l'image. Chaîne encodée en base64. |
Blob
| Représentation JSON |
|---|
{ "mimeType": string, "data": string } |
| Champs | |
|---|---|
mimeType |
Obligatoire. Type MIME standard IANA des données sources. |
data |
Obligatoire. Octets bruts du blob. Chaîne encodée en base64. |
Événement
| Représentation JSON |
|---|
{ "event": string } |
| Champs | |
|---|---|
event |
Obligatoire. Nom de l'événement. |
AgentTransfer
| Représentation JSON |
|---|
{ "targetAgent": string, "displayName": string } |
| Champs | |
|---|---|
targetAgent |
Obligatoire. Agent auquel la conversation est transférée. L'agent prendra le relais à partir de ce moment. Format : |
displayName |
Uniquement en sortie. Nom à afficher de l'agent. |
GoldenExpectation
| Représentation JSON |
|---|
{ "note": string, "skipEvaluation": boolean, "expectationLevelMetricsThresholdsOverride": { object ( |
| Champs | |
|---|---|
note |
Facultatif. Note concernant cette exigence, utile pour les rapports lorsque des vérifications spécifiques échouent. Exemple : "Check_Payment_Tool_Called". |
skipEvaluation |
Facultatif. Si la valeur est définie sur "true", cette attente spécifique ne sera pas évaluée. |
expectationLevelMetricsThresholdsOverride |
Facultatif. Remplace les métriques au niveau de l'étape. |
agentResponseSemanticSimilarityMetricsConfigOverride |
Facultatif. Remplacements pour les métriques de similarité sémantique de agent_response. |
agentResponseHallucinationMetricsConfigOverride |
Facultatif. Remplace les métriques d'hallucination agent_response. |
comparisonType |
Facultatif. Type de comparaison à utiliser pour la vérification des attentes. |
Champ d'union condition. Vérification à effectuer. condition ne peut être qu'un des éléments suivants : |
|
toolCall |
Facultatif. Vérifiez qu'un outil spécifique a été appelé avec les paramètres. |
toolResponse |
Facultatif. Vérifiez qu'un outil spécifique a donné la réponse attendue. |
agentResponse |
Facultatif. Vérifiez que l'agent a répondu correctement. Le rôle "agent" est implicite. |
agentTransfer |
Facultatif. Vérifiez que l'agent a transféré la conversation à un autre agent. |
updatedVariables |
Facultatif. Vérifiez que l'agent a défini les variables de session sur les valeurs attendues. Permet également de capturer les mises à jour des variables d'agent pour les évaluations de référence. |
mockToolResponse |
Facultatif. Réponse de l'outil à simuler, avec les paramètres d'intérêt spécifiés. Tous les paramètres non spécifiés seront générés par le LLM. |
noToolCalls |
Facultatif. Vérifiez qu'aucun outil n'a été appelé pendant ce tour. |
ToolCall
| Représentation JSON |
|---|
{ "id": string, "displayName": string, "args": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Champs | |
|---|---|
id |
Facultatif. Identifiant unique de l'appel d'outil. Si ce champ est renseigné, le client doit renvoyer le résultat de l'exécution avec l'ID correspondant dans |
displayName |
Uniquement en sortie. Nom à afficher de l'outil. |
args |
Facultatif. Paramètres et valeurs d'entrée de l'outil au format d'objet JSON. |
parentToolCallId |
Uniquement en sortie. ID de l'appel d'outil qui a déclenché celui-ci, lorsqu'il a été émis par un sous-agent travaillant pour le compte d'un appel parent. Vide pour les appels de premier niveau. Permet à un client de regrouper le travail d'un sous-agent sous l'appel qui l'a déclenché au lieu de rendre chaque étape en tant que frère. |
agentName |
Uniquement en sortie. Nom lisible de l'agent qui a émis cet appel, par exemple "Architecte de contrat". Vide lorsque l'agent racine l'a émis. |
Champ d'union tool_identifier. Identifiant de l'outil à exécuter. Il peut s'agir d'un outil persistant ou d'un outil d'un ensemble d'outils. tool_identifier ne peut être qu'un des éléments suivants : |
|
tool |
Facultatif. Nom de l'outil à exécuter. Format : |
toolsetTool |
Facultatif. Outil de l'ensemble d'outils à exécuter. |
Message
| Représentation JSON |
|---|
{
"role": string,
"chunks": [
{
object ( |
| Champs | |
|---|---|
role |
Facultatif. Rôle dans la conversation (utilisateur, agent, etc.). |
chunks[] |
Facultatif. Contenu du message sous forme de série de blocs. |
eventTime |
Facultatif. Code temporel de l'envoi ou de la réception du message. Ne doit pas être utilisé si le message fait partie d'un Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
Bloc
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union data. Regroupez les données. data ne peut être qu'un des éléments suivants : |
|
text |
Facultatif. Données textuelles. |
transcript |
Facultatif. Transcription associée à l'élément audio. |
blob |
Facultatif. Données blob. |
payload |
Facultatif. Données de charge utile personnalisées. |
image |
Facultatif. Données d'image. |
toolCall |
Facultatif. Requête d'exécution d'outil. |
toolResponse |
Facultatif. Réponse à l'exécution de l'outil. |
agentTransfer |
Facultatif. Événement de transfert d'agent. |
updatedVariables |
Une structure représente les variables qui ont été mises à jour dans la conversation, avec les noms de variables comme clés. |
defaultVariables |
Une structure représente les variables par défaut au début de la conversation, avec les noms de variables comme clés. |
Horodatage
| Représentation JSON |
|---|
{ "seconds": string, "nanos": integer } |
| Champs | |
|---|---|
seconds |
Représente les secondes de l'heure UTC à partir de l'epoch Unix 1970-01-01T00:00:00Z. La valeur doit être comprise entre -62135596800 et 253402300799 inclus (ce qui correspond à 0001-01-01T00:00:00Z et 9999-12-31T23:59:59Z). |
nanos |
Fractions de secondes non négatives avec une précision de l'ordre de la nanoseconde. Ce champ correspond à la partie en nanosecondes de la durée, et non à une alternative aux secondes. Les valeurs de secondes négatives avec des fractions doivent toujours comporter des valeurs de nanosecondes non négatives comptabilisées dans le temps. La valeur doit être comprise entre 0 et 999 999 999 inclus. |
ExpectationLevelMetricsThresholds
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union
|
|
toolInvocationParameterCorrectnessThreshold |
Facultatif. Seuil de réussite pour la justesse des paramètres d'appel d'outil individuel. Doit être un nombre à virgule flottante compris entre 0 et 1. La valeur par défaut est 1.0. |
SemanticSimilarityMetricsConfig
| Représentation JSON |
|---|
{ "enableSemanticSimilarityMetrics": boolean } |
| Champs | |
|---|---|
enableSemanticSimilarityMetrics |
Facultatif. Indique si les métriques de similarité sémantique doivent être calculées pour l'évaluation. |
HallucinationMetricsConfig
| Représentation JSON |
|---|
{ "enableHallucinationMetrics": boolean } |
| Champs | |
|---|---|
enableHallucinationMetrics |
Facultatif. Indique si les métriques d'hallucination doivent être calculées pour l'évaluation. |
Segment
| Représentation JSON |
|---|
{
"name": string,
"startTime": string,
"endTime": string,
"duration": string,
"attributes": {
object
},
"childSpans": [
{
object ( |
| Champs | |
|---|---|
name |
Uniquement en sortie. Nom du segment. |
startTime |
Uniquement en sortie. Heure de début du segment. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
endTime |
Uniquement en sortie. Heure de fin de l'étendue. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
duration |
Uniquement en sortie. Durée du segment. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
attributes |
Uniquement en sortie. Attributs clé-valeur associés à la portée. |
childSpans[] |
Uniquement en sortie. Les portées enfants imbriquées sous cette portée. |
Durée
| Représentation JSON |
|---|
{ "seconds": string, "nanos": integer } |
| Champs | |
|---|---|
seconds |
Secondes signées de la période. La valeur doit être comprise entre -315 576 000 000 et +315 576 000 000 (inclus). Remarque : Ces limites sont calculées à partir de : 60 s/min * 60 min/h * 24 h/jour * 365,25 jours/an * 10 000 ans |
nanos |
Fractions de secondes signées avec une précision de l'ordre de la nanoseconde pour la durée. Les durées inférieures à une seconde sont représentées par un champ |
TurnLevelMetricsThresholds
| Représentation JSON |
|---|
{ "semanticSimilarityChannel": enum ( |
| Champs | |
|---|---|
semanticSimilarityChannel |
Facultatif. Canal de similarité sémantique à utiliser pour l'évaluation. |
Champ d'union
|
|
semanticSimilaritySuccessThreshold |
Facultatif. Seuil de réussite pour la similarité sémantique. Veuillez saisir un nombre entier compris entre 0 et 4. La valeur par défaut est >= 3. |
Champ d'union
|
|
overallToolInvocationCorrectnessThreshold |
Facultatif. Seuil de réussite pour la correction globale de l'appel d'outil. Doit être un nombre à virgule flottante compris entre 0 et 1. La valeur par défaut est 1.0. |
Scénario
| Représentation JSON |
|---|
{ "task": string, "userFacts": [ { object ( |
| Champs | |
|---|---|
task |
Obligatoire. Tâche à cibler par le scénario. |
userFacts[] |
Facultatif. Faits utilisateur à utiliser par le scénario. |
maxTurns |
Facultatif. Nombre maximal de tours à simuler. La valeur maximale autorisée est de 100. La valeur par défaut est 100. |
rubrics[] |
Obligatoire. Rubriques permettant d'évaluer le scénario. |
scenarioExpectations[] |
Obligatoire. Les ScenarioExpectations permettant d'évaluer la conversation produite par la simulation utilisateur. |
variableOverrides |
Facultatif. Variables / paramètres de session en tant que contexte pour la session, avec les noms de variables comme clés. Les membres de cette structure remplaceront toutes les valeurs par défaut définies par le système. Notez que ces faits sont différents des faits utilisateur, qui sont des faits connus de l'utilisateur. Les variables sont des paramètres connus de l'agent, c'est-à-dire le numéro de téléphone transmis par le système de téléphonie. |
taskCompletionBehavior |
Facultatif. Obsolète. Utilisez plutôt user_goal_behavior. |
userGoalBehavior |
Facultatif. Comportement attendu de l'objectif utilisateur. |
evaluationExpectations[] |
Facultatif. Attentes d'évaluation pour évaluer la conversation produite par la simulation. Format : |
scenarioExecutionMode |
Facultatif. Mode d'exécution pour les évaluations de scénarios. |
UserFact
| Représentation JSON |
|---|
{ "name": string, "value": string } |
| Champs | |
|---|---|
name |
Obligatoire. Nom du fait utilisateur. |
value |
Obligatoire. Valeur du fait utilisateur. |
ScenarioExpectation
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union expectation. L'attente d'évaluer la conversation produite par la simulation. expectation ne peut être qu'un des éléments suivants : |
|
toolExpectation |
Facultatif. Paire d'appel et de réponse de l'outil à évaluer. |
agentResponse |
Facultatif. Réponse de l'agent à évaluer. |
ToolExpectation
| Représentation JSON |
|---|
{ "expectedToolCall": { object ( |
| Champs | |
|---|---|
expectedToolCall |
Obligatoire. Appel d'outil attendu, avec les paramètres d'intérêt spécifiés. Tous les paramètres non spécifiés seront générés par le LLM. |
mockToolResponse |
Obligatoire. Réponse de l'outil à simuler, avec les paramètres d'intérêt spécifiés. Tous les paramètres non spécifiés seront générés par le LLM. |
AggregatedMetrics
| Représentation JSON |
|---|
{
"metricsByAppVersion": [
{
object ( |
| Champs | |
|---|---|
metricsByAppVersion[] |
Uniquement en sortie. Métriques agrégées, regroupées par ID de version de l'application. |
MetricsByAppVersion
| Représentation JSON |
|---|
{ "appVersionId": string, "toolMetrics": [ { object ( |
| Champs | |
|---|---|
appVersionId |
Uniquement en sortie. ID de version de l'application. |
toolMetrics[] |
Uniquement en sortie. Métriques pour chaque outil de cette version de l'application. |
semanticSimilarityMetrics[] |
Uniquement en sortie. Métriques de similarité sémantique dans cette version de l'application. |
hallucinationMetrics[] |
Uniquement en sortie. Métriques concernant les hallucinations dans cette version de l'application. |
toolCallLatencyMetrics[] |
Uniquement en sortie. Métriques pour la latence des appels d'outils dans cette version de l'application. |
turnLatencyMetrics[] |
Uniquement en sortie. Métriques pour la latence des tours dans cette version de l'application. |
passCount |
Uniquement en sortie. Nombre de fois où l'évaluation a été réussie. |
failCount |
Uniquement en sortie. Nombre d'échecs de l'évaluation. |
metricsByTurn[] |
Uniquement en sortie. Métriques agrégées par tour dans cette version de l'application. |
ToolMetrics
| Représentation JSON |
|---|
{ "tool": string, "passCount": integer, "failCount": integer } |
| Champs | |
|---|---|
tool |
Uniquement en sortie. Nom de l'outil. |
passCount |
Uniquement en sortie. Nombre de fois où l'outil a réussi. |
failCount |
Uniquement en sortie. Nombre d'échecs de l'outil. |
SemanticSimilarityMetrics
| Représentation JSON |
|---|
{ "score": number } |
| Champs | |
|---|---|
score |
Uniquement en sortie. Score moyen de similarité sémantique (de 0 à 4). |
HallucinationMetrics
| Représentation JSON |
|---|
{ "score": number } |
| Champs | |
|---|---|
score |
Uniquement en sortie. Score moyen d'hallucination (de 0 à 1). |
ToolCallLatencyMetrics
| Représentation JSON |
|---|
{ "tool": string, "averageLatency": string } |
| Champs | |
|---|---|
tool |
Uniquement en sortie. Nom de l'outil. |
averageLatency |
Uniquement en sortie. Latence moyenne des appels d'outils. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
TurnLatencyMetrics
| Représentation JSON |
|---|
{ "averageLatency": string } |
| Champs | |
|---|---|
averageLatency |
Uniquement en sortie. Latence moyenne des tours. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
MetricsByTurn
| Représentation JSON |
|---|
{ "turnIndex": integer, "toolMetrics": [ { object ( |
| Champs | |
|---|---|
turnIndex |
Uniquement en sortie. Index du tour (basé sur 0). |
toolMetrics[] |
Uniquement en sortie. Métriques pour chaque outil de ce tour. |
semanticSimilarityMetrics[] |
Uniquement en sortie. Métriques de similarité sémantique pour ce tour. |
hallucinationMetrics[] |
Uniquement en sortie. Métriques pour l'hallucination au cours de ce tour. |
toolCallLatencyMetrics[] |
Uniquement en sortie. Métriques de latence des appels d'outils au cours de ce tour. |
turnLatencyMetrics[] |
Uniquement en sortie. Métriques de latence de tour dans ce tour. |
EvaluationResult
| Représentation JSON |
|---|
{ "name": string, "displayName": string, "createTime": string, "evaluationStatus": enum ( |
| Champs | |
|---|---|
name |
Identifiant. Identifiant unique du résultat de l'évaluation. Format : |
displayName |
Obligatoire. Nom à afficher du résultat de l'évaluation. Unique dans une évaluation. Par défaut, il se présente au format suivant : " |
createTime |
Uniquement en sortie. Code temporel de la création du résultat de l'évaluation. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
evaluationStatus |
Uniquement en sortie. Résultat de l'évaluation. N'est renseigné que si execution_state est défini sur "COMPLETE". |
evaluationRun |
Uniquement en sortie. Exécution de l'évaluation ayant généré ce résultat. Format : |
persona |
Uniquement en sortie. Personnalité utilisée pour générer la conversation pour le résultat de l'évaluation. |
errorInfo |
Uniquement en sortie. Informations sur les erreurs liées au résultat de l'évaluation. |
error |
Uniquement en sortie. Obsolète : utilisez plutôt |
initiatedBy |
Uniquement en sortie. Utilisateur ayant lancé l'exécution de l'évaluation qui a généré ce résultat. |
appVersion |
Uniquement en sortie. Version de l'application utilisée pour générer la conversation ayant abouti à ce résultat. Format : |
appVersionDisplayName |
Uniquement en sortie. Nom à afficher du |
changelog |
Uniquement en sortie. Journal des modifications de la version de l'application par rapport à laquelle l'évaluation a été exécutée. Cette valeur est renseignée si l'utilisateur exécute l'évaluation sur la dernière version ou le brouillon. |
changelogCreateTime |
Uniquement en sortie. Heure de création du journal des modifications de la version de l'application par rapport à laquelle l'évaluation a été exécutée. Cette valeur est renseignée si l'utilisateur exécute l'évaluation sur la dernière version ou le brouillon. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
executionState |
Uniquement en sortie. État de l'exécution du résultat de l'évaluation. |
evaluationMetricsThresholds |
Uniquement en sortie. Seuils d'évaluation pour le résultat. |
config |
Uniquement en sortie. Configuration utilisée lors de l'exécution de l'évaluation ayant généré ce résultat. |
goldenRunMethod |
Uniquement en sortie. Méthode utilisée pour exécuter l'évaluation de référence. |
rootSpan |
Uniquement en sortie. Portée racine de l'exécution de l'évaluation, qui inclut des informations sur chaque étape de l'évaluation. |
outcomeMetadata |
Uniquement en sortie. Métadonnées de résultat de l'évaluation. N'est renseigné que si execution_state est défini sur "COMPLETE". |
Champ d'union result. Résultat de l'évaluation. N'est renseigné que lorsque l'état d'exécution est "COMPLETED". result ne peut être qu'un des éléments suivants : |
|
goldenResult |
Uniquement en sortie. Résultat d'une évaluation de référence. |
scenarioResult |
Uniquement en sortie. Résultat d'une évaluation de scénario. |
GoldenResult
| Représentation JSON |
|---|
{ "turnReplayResults": [ { object ( |
| Champs | |
|---|---|
turnReplayResults[] |
Uniquement en sortie. Résultat de l'exécution de chaque tour de la conversation de référence. |
evaluationExpectationResults[] |
Uniquement en sortie. les résultats attendus de l'évaluation. |
TurnReplayResult
| Représentation JSON |
|---|
{ "conversation": string, "expectationOutcome": [ { object ( |
| Champs | |
|---|---|
conversation |
Uniquement en sortie. Conversation générée pour ce tour. |
expectationOutcome[] |
Uniquement en sortie. Le résultat de chaque attente. |
hallucinationResult |
Uniquement en sortie. Résultat de la vérification des hallucinations. |
toolInvocationScore |
Uniquement en sortie. Obsolète. Utilisez plutôt OverallToolInvocationResult. |
turnLatency |
Uniquement en sortie. Durée du tour. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
toolCallLatencies[] |
Uniquement en sortie. Latence de chaque appel d'outil dans le tour. |
semanticSimilarityResult |
Uniquement en sortie. Résultat de la vérification de la similarité sémantique. |
overallToolInvocationResult |
Uniquement en sortie. Résultat de la vérification globale de l'appel d'outil. |
errorInfo |
Uniquement en sortie. Informations sur l'erreur qui s'est produite lors de ce tour. |
spanLatencies[] |
Uniquement en sortie. Latence des spans dans le tour. |
Champ d'union
|
|
toolOrderedInvocationScore |
Uniquement en sortie. Score global d'invocation d'outil pour ce tour. Indique le pourcentage global d'outils du tour attendu qui ont été réellement appelés dans l'ordre attendu. |
GoldenExpectationOutcome
| Représentation JSON |
|---|
{ "expectation": { object ( |
| Champs | |
|---|---|
expectation |
Uniquement en sortie. L'attente qui a été évaluée. |
outcome |
Uniquement en sortie. Résultat attendu. |
semanticSimilarityResult |
Uniquement en sortie. Résultat de la vérification de la similarité sémantique. |
toolInvocationResult |
Uniquement en sortie. Résultat de la vérification de l'appel d'outil. |
Champ d'union result. Résultat de l'attente. result ne peut être qu'un des éléments suivants : |
|
observedToolCall |
Uniquement en sortie. Résultat attendu de l'appel d'outil. |
observedToolResponse |
Uniquement en sortie. Résultat de l'attente de réponse de l'outil. |
observedAgentResponse |
Uniquement en sortie. Résultat de l'attente de réponse de l'agent. |
observedAgentTransfer |
Uniquement en sortie. Résultat de l'attente de transfert de l'agent. |
observedPayload |
Uniquement en sortie. Charge utile personnalisée observée. Il n'y a aucune attente concernant les charges utiles personnalisées. Elle n'est utilisée que pour le calcul des métriques. Le résultat est toujours "SKIPPED" (IGNORÉ). |
SemanticSimilarityResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, "outcome": enum ( |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 4 : entièrement cohérent Score 3 : principalement cohérent Score 2 : partiellement cohérent (omissions mineures) Score 1 : largement incohérent (omissions majeures) Score 0 : complètement incohérent / contradictoire |
explanation |
Uniquement en sortie. Explication du score de similarité sémantique. |
outcome |
Uniquement en sortie. Résultat de la vérification de la similarité sémantique. Pour ce faire, le score est comparé à semantic_similarity_success_threshold. Si le score est égal ou supérieur au seuil, le résultat est "RÉUSSITE". Sinon, le résultat sera FAIL. |
Champ d'union
|
|
score |
Uniquement en sortie. Score de similarité sémantique. Peut être égal à 0, 1, 2, 3 ou 4. |
ToolInvocationResult
| Représentation JSON |
|---|
{ "outcome": enum ( |
| Champs | |
|---|---|
outcome |
Uniquement en sortie. Résultat de la vérification de l'appel d'outil. Pour ce faire, le paramètre "parameter_correctness_score" est comparé au seuil. Si le score est égal ou supérieur au seuil, le résultat est "RÉUSSITE". Sinon, le résultat sera FAIL. |
explanation |
Uniquement en sortie. Explication en texte libre du résultat de l'appel d'outil. |
Champ d'union
|
|
parameterCorrectnessScore |
Uniquement en sortie. Score d'exactitude du paramètre d'invocation d'outil. Indique le pourcentage de paramètres de l'appel d'outil attendu qui étaient également présents dans l'appel d'outil réel. |
HallucinationResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 1 : Justifié Score 0 : Non justifié Score -1 : Aucune affirmation à évaluer |
explanation |
Uniquement en sortie. Explication du score d'hallucination. |
Champ d'union
|
|
score |
Uniquement en sortie. Score d'hallucination. Valeurs possibles : -1, 0 ou 1. |
ToolCallLatency
| Représentation JSON |
|---|
{ "tool": string, "displayName": string, "startTime": string, "endTime": string, "executionLatency": string } |
| Champs | |
|---|---|
tool |
Uniquement en sortie. Nom de l'outil exécuté. Format : |
displayName |
Uniquement en sortie. Nom à afficher de l'outil. |
startTime |
Uniquement en sortie. Heure de début de l'exécution de l'appel d'outil. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
endTime |
Uniquement en sortie. Heure de fin de l'exécution de l'appel d'outil. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
executionLatency |
Uniquement en sortie. Latence de l'exécution de l'appel d'outil. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
OverallToolInvocationResult
| Représentation JSON |
|---|
{ "outcome": enum ( |
| Champs | |
|---|---|
outcome |
Uniquement en sortie. Résultat de la vérification de l'appel d'outil. Cette valeur est déterminée en comparant tool_invocation_score au seuil overall_tool_invocation_correctness_threshold. Si le score est égal ou supérieur au seuil, le résultat est "RÉUSSITE". Sinon, le résultat sera FAIL. |
Champ d'union
|
|
toolInvocationScore |
Score global d'appel d'outil pour ce tour. Indique le pourcentage global d'outils de la réponse attendue qui ont été réellement appelés. |
EvaluationErrorInfo
| Représentation JSON |
|---|
{
"errorType": enum ( |
| Champs | |
|---|---|
errorType |
Uniquement en sortie. Type d'erreur. |
errorMessage |
Uniquement en sortie. Message d'erreur. |
sessionId |
Uniquement en sortie. ID de session de la conversation à l'origine de l'erreur. |
userFacingErrorMessage |
Uniquement en sortie. Message d'erreur visible par l'utilisateur. |
SpanLatency
| Représentation JSON |
|---|
{ "type": enum ( |
| Champs | |
|---|---|
type |
Uniquement en sortie. Type de span. |
displayName |
Uniquement en sortie. Nom à afficher du segment. S'applique aux étendues d'outils et de garde-fous. |
startTime |
Uniquement en sortie. Heure de début du segment. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
endTime |
Uniquement en sortie. Heure de fin du segment. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
executionLatency |
Uniquement en sortie. Latence du segment. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
Champ d'union identifier. Identifiant de l'élément spécifique en fonction de son type. identifier ne peut être qu'un des éléments suivants : |
|
resource |
Uniquement en sortie. Nom de ressource des étendues de garde-fou ou d'outil. |
toolset |
Uniquement en sortie. Identifiant de l'outil dans l'ensemble d'outils. |
model |
Uniquement en sortie. Nom du segment LLM. |
callback |
Uniquement en sortie. Nom de la portée du rappel utilisateur. |
EvaluationExpectationResult
| Représentation JSON |
|---|
{
"evaluationExpectation": string,
"prompt": string,
"outcome": enum ( |
| Champs | |
|---|---|
evaluationExpectation |
Uniquement en sortie. L'attente d'évaluation. Format : |
prompt |
Uniquement en sortie. Requête utilisée pour l'évaluation. |
outcome |
Uniquement en sortie. Résultat attendu de l'évaluation. |
explanation |
Uniquement en sortie. Explication du résultat. |
ScenarioResult
| Représentation JSON |
|---|
{ "conversation": string, "task": string, "userFacts": [ { object ( |
| Champs | |
|---|---|
conversation |
Uniquement en sortie. Conversation générée dans le scénario. |
task |
Uniquement en sortie. Tâche utilisée lors de l'exécution du scénario pour ce résultat. |
userFacts[] |
Uniquement en sortie. Faits sur l'utilisateur utilisés par le scénario pour ce résultat. |
expectationOutcomes[] |
Uniquement en sortie. Le résultat de chaque attente. |
rubricOutcomes[] |
Uniquement en sortie. Résultat de la grille d'évaluation. |
hallucinationResult[] |
Uniquement en sortie. Résultat de la vérification des hallucinations. Il y aura un résultat d'hallucination pour chaque tour de conversation. |
taskCompletionResult |
Uniquement en sortie. Résultat de la vérification de l'exécution de la tâche. |
toolCallLatencies[] |
Uniquement en sortie. Latence de l'exécution de chaque appel d'outil dans la conversation. |
userGoalSatisfactionResult |
Uniquement en sortie. Résultat de la vérification de la satisfaction de l'objectif de l'utilisateur. |
spanLatencies[] |
Uniquement en sortie. Latence des portées dans la conversation. |
evaluationExpectationResults[] |
Uniquement en sortie. les résultats attendus de l'évaluation. |
Champ d'union
|
|
allExpectationsSatisfied |
Uniquement en sortie. Indique si toutes les attentes ont été satisfaites pour ce tour. |
Champ d'union
|
|
taskCompleted |
Uniquement en sortie. Indique si la tâche a été effectuée pour ce tour. Il s'agit d'une combinaison de toutes les attentes satisfaites, de l'absence d'hallucinations et de la satisfaction de l'objectif de l'utilisateur. |
ScenarioExpectationOutcome
| Représentation JSON |
|---|
{ "expectation": { object ( |
| Champs | |
|---|---|
expectation |
Uniquement en sortie. L'attente qui a été évaluée. |
outcome |
Uniquement en sortie. Résultat de ScenarioExpectation. |
Champ d'union result. Résultat de l'attente. result ne peut être qu'un des éléments suivants : |
|
observedToolCall |
Uniquement en sortie. Appel d'outil observé. |
observedAgentResponse |
Uniquement en sortie. Réponse de l'agent observée. |
ObservedToolCall
| Représentation JSON |
|---|
{ "toolCall": { object ( |
| Champs | |
|---|---|
toolCall |
Uniquement en sortie. Appel d'outil observé. |
toolResponse |
Uniquement en sortie. Réponse de l'outil observée. |
ScenarioRubricOutcome
| Représentation JSON |
|---|
{ "rubric": string, "scoreExplanation": string, // Union field |
| Champs | |
|---|---|
rubric |
Uniquement en sortie. Grille d'évaluation utilisée pour évaluer la conversation. |
scoreExplanation |
Uniquement en sortie. Réponse de l'évaluateur à la grille d'évaluation. |
Champ d'union
|
|
score |
Uniquement en sortie. Score de la conversation par rapport à la grille d'évaluation. |
TaskCompletionResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 1 : tâche terminée Score 0 : tâche non terminée Score -1 : objectif de l'utilisateur non défini |
explanation |
Uniquement en sortie. Explication du score d'accomplissement des tâches. |
Champ d'union
|
|
score |
Uniquement en sortie. Score d'exécution de la tâche. Valeurs possibles : -1, 0 ou 1 |
UserGoalSatisfactionResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 2 : Transfert fluide Score 1 : Tâche utilisateur effectuée Score 0 : Tâche utilisateur non effectuée Score -1 : Tâche utilisateur non spécifiée |
explanation |
Uniquement en sortie. Explication du score de satisfaction des tâches utilisateur. |
Champ d'union
|
|
score |
Uniquement en sortie. Score de satisfaction de l'utilisateur concernant la tâche. Valeurs possibles : -1, 0, 1, 2. |
EvaluationPersona
| Représentation JSON |
|---|
{
"name": string,
"description": string,
"displayName": string,
"personality": string,
"speechConfig": {
object ( |
| Champs | |
|---|---|
name |
Obligatoire. Identifiant unique de la persona. Format : |
description |
Facultatif. Description du persona. |
displayName |
Obligatoire. Nom à afficher de la persona. Unique dans une application. |
personality |
Obligatoire. Instruction indiquant à l'agent comment se comporter lors de l'évaluation. |
speechConfig |
Facultatif. Configuration de la voix de la persona (paramètres TTS). |
SpeechConfig
| Représentation JSON |
|---|
{
"speakingRate": number,
"environment": enum ( |
| Champs | |
|---|---|
speakingRate |
Facultatif. Vitesse d'élocution. 1.0 est la valeur normale. Une valeur faible (par exemple, 0,8) indique une vitesse lente, tandis qu'une valeur élevée (par exemple, 1,5) indique une vitesse rapide. Utile pour tester la façon dont l'agent gère les personnes qui parlent vite. |
environment |
Facultatif. Environnement audio simulé. |
voiceId |
Facultatif. Identifiant/accent de voix spécifique à utiliser. Exemple : "en-US-Wavenet-D" ou "en-GB-Standard-A" |
État
| Représentation JSON |
|---|
{ "code": integer, "message": string, "details": [ { "@type": string, field1: ..., ... } ] } |
| Champs | |
|---|---|
code |
Code d'état, qui doit être une valeur d'énumération de |
message |
Message d'erreur destiné au développeur, qui doit être en anglais. Tout message d'erreur destiné aux utilisateurs doit être localisé et envoyé dans le champ |
details[] |
Liste de messages comportant les détails de l'erreur. Il existe un ensemble commun de types de message utilisable par les API. Objet contenant des champs d'un type arbitraire. Un champ supplémentaire |
Tous
| Représentation JSON |
|---|
{ "typeUrl": string, "value": string } |
| Champs | |
|---|---|
typeUrl |
Identifie le type du message Protobuf sérialisé avec une référence URI composée d'un préfixe se terminant par une barre oblique et du nom de type complet. Exemple : type.googleapis.com/google.protobuf.StringValue Cette chaîne doit contenir au moins un caractère Le préfixe est arbitraire et les implémentations Protobuf sont censées supprimer tout ce qui précède le dernier Toutes les chaînes d'URL de type doivent être des références URI valides, avec la restriction supplémentaire (pour le format texte) que le contenu de la référence ne doit comporter que des caractères alphanumériques, des séquences d'échappement encodées en pourcentage et des caractères de l'ensemble suivant (sans les accents graves extérieurs) : Dans la conception d'origine de |
value |
Contient une sérialisation Protobuf du type décrit par type_url. Chaîne encodée en base64. |
EvaluationMetricsThresholds
| Représentation JSON |
|---|
{ "goldenEvaluationMetricsThresholds": { object ( |
| Champs | |
|---|---|
goldenEvaluationMetricsThresholds |
Facultatif. Seuils des métriques d'évaluation privilégiées. |
hallucinationMetricBehavior |
Facultatif. Obsolète : utilisez plutôt |
goldenHallucinationMetricBehavior |
Facultatif. Comportement de la métrique d'hallucination pour les évaluations de référence. |
scenarioHallucinationMetricBehavior |
Facultatif. Comportement de la métrique d'hallucination pour les évaluations de scénarios. |
GoldenEvaluationMetricsThresholds
| Représentation JSON |
|---|
{ "turnLevelMetricsThresholds": { object ( |
| Champs | |
|---|---|
turnLevelMetricsThresholds |
Facultatif. Seuils des métriques au niveau du tour. |
expectationLevelMetricsThresholds |
Facultatif. Seuils des métriques de niveau d'attente. |
toolMatchingSettings |
Facultatif. Paramètres de correspondance de l'outil. Un appel d'outil supplémentaire est un appel d'outil présent dans l'exécution, mais qui ne correspond à aucun appel d'outil dans l'attente de référence. |
ToolMatchingSettings
| Représentation JSON |
|---|
{
"extraToolCallBehavior": enum ( |
| Champs | |
|---|---|
extraToolCallBehavior |
Facultatif. Comportement pour les appels d'outils supplémentaires. La valeur par défaut est "FAIL". |
EvaluationConfig
| Représentation JSON |
|---|
{ "inputAudioConfig": { object ( |
| Champs | |
|---|---|
inputAudioConfig |
Facultatif. Configuration pour le traitement de l'entrée audio. |
outputAudioConfig |
Facultatif. Configuration pour générer le contenu audio de sortie. |
evaluationChannel |
Facultatif. Canal à évaluer. |
toolCallBehaviour |
Facultatif. Indique si l'évaluation doit utiliser de vrais appels d'outils ou de faux outils. |
InputAudioConfig
| Représentation JSON |
|---|
{
"audioEncoding": enum ( |
| Champs | |
|---|---|
audioEncoding |
Obligatoire. Encodage des données audio d'entrée. |
sampleRateHertz |
Obligatoire. Taux d'échantillonnage (en hertz) des données audio d'entrée. |
noiseSuppressionLevel |
Facultatif. Indique si la suppression du bruit doit être activée pour l'entrée audio. Les valeurs disponibles sont "low", "moderate", "high" et "very_high". |
OutputAudioConfig
| Représentation JSON |
|---|
{
"audioEncoding": enum ( |
| Champs | |
|---|---|
audioEncoding |
Obligatoire. Encodage des données audio de sortie. |
sampleRateHertz |
Obligatoire. Taux d'échantillonnage (en hertz) des données audio de sortie. |
EvaluationMetricsConfig
| Représentation JSON |
|---|
{ "goldenMetricsConfig": { object ( |
| Champs | |
|---|---|
goldenMetricsConfig |
Facultatif. Configuration des métriques clés pour l'évaluation. |
scenarioMetricsConfig |
Facultatif. Configuration des métriques de scénario pour l'évaluation. |
GoldenMetricsConfig
| Représentation JSON |
|---|
{ "semanticSimilarityMetricsConfig": { object ( |
| Champs | |
|---|---|
semanticSimilarityMetricsConfig |
Facultatif. Configuration globale pour les métriques de similarité sémantique. |
toolCorrectnessMetricsConfig |
Facultatif. Configuration des métriques d'exactitude de l'outil au niveau du tour. |
stepToolCorrectnessMetricsConfig |
Facultatif. Configuration des métriques d'exactitude des outils au niveau des étapes. |
ToolCorrectnessMetricsConfig
| Représentation JSON |
|---|
{ "enableToolCorrectnessMetrics": boolean } |
| Champs | |
|---|---|
enableToolCorrectnessMetrics |
Facultatif. Indique si les métriques d'exactitude des outils doivent être calculées pour l'évaluation. |
ScenarioMetricsConfig
| Représentation JSON |
|---|
{ "userGoalMetMetricsConfig": { object ( |
| Champs | |
|---|---|
userGoalMetMetricsConfig |
Facultatif. Configuration des métriques "Objectif utilisateur atteint". |
expectationsMetMetricsConfig |
Facultatif. Configuration des métriques de niveau d'attente. |
UserGoalMetMetricsConfig
| Représentation JSON |
|---|
{ "enableUserGoalMetMetrics": boolean } |
| Champs | |
|---|---|
enableUserGoalMetMetrics |
Facultatif. Indique si les métriques sur les objectifs utilisateur atteints doivent être calculées pour l'évaluation. |
ExpectationsMetMetricsConfig
| Représentation JSON |
|---|
{ "enableExpectationsMetMetrics": boolean } |
| Champs | |
|---|---|
enableExpectationsMetMetrics |
Facultatif. Indique si les métriques de niveau d'attente doivent être calculées pour l'évaluation. |
NullValue
Représente un null JSON.
NullValue est une sentinelle qui utilise une énumération avec une seule valeur pour représenter la valeur nulle de l'union de type Value.
Un champ de type NullValue avec une valeur autre que 0 est considéré comme non valide. La plupart des sérialiseurs ProtoJSON émettent un Value avec un null_value défini comme null JSON, quelle que soit la valeur entière, et effectuent donc un aller-retour vers une valeur 0.
| Enums | |
|---|---|
NULL_VALUE |
Valeur nulle. |
ComparisonType
Types de comparaison acceptés pour vérifier la réponse de l'agent.
| Enums | |
|---|---|
COMPARISON_TYPE_UNSPECIFIED |
Type de comparaison non spécifié. Le comportement par défaut est SEMANTIC_SIMILARITY pour les réponses de l'agent et les appels d'outils. |
EQUALS |
Correspondance exacte de chaîne. |
CONTAINS |
Correspondance de sous-chaîne (vérifie si la chaîne attendue est contenue dans la réponse réelle). |
SEMANTIC_SIMILARITY |
Correspondance de similarité sémantique (évalue la similarité de sens à l'aide d'un LLM). |
SemanticSimilarityChannel
Canal de similarité sémantique à utiliser.
| Enums | |
|---|---|
SEMANTIC_SIMILARITY_CHANNEL_UNSPECIFIED |
Métrique non spécifiée. La valeur par défaut est TEXT. |
TEXT |
Utilisez la similarité sémantique du texte. |
AUDIO |
Utilisez la similarité sémantique audio. |
HallucinationMetricBehavior
Comportement de la métrique d'hallucination. Quel que soit le comportement, la métrique sera toujours calculée. La différence est que, lorsqu'elle est désactivée, la métrique n'est pas utilisée pour calculer le score d'évaluation global.
| Enums | |
|---|---|
HALLUCINATION_METRIC_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié de la métrique d'hallucination. |
DISABLED |
Désactivez la métrique d'hallucination. |
ENABLED |
Activez la métrique d'hallucination. |
TaskCompletionBehavior
Comportement attendu de la tâche utilisateur. Il permet de déterminer si le scénario est réussi.
| Enums | |
|---|---|
TASK_COMPLETION_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié. La valeur par défaut est TASK_SATISFIED. |
TASK_SATISFIED |
La tâche de l'utilisateur doit être effectuée avec succès. |
TASK_REJECTED |
La tâche de l'utilisateur doit être refusée. |
UserGoalBehavior
Comportement attendu de l'objectif utilisateur. Il permet de déterminer si le scénario est réussi.
| Enums | |
|---|---|
USER_GOAL_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié. La valeur par défaut est USER_GOAL_SATISFIED. |
USER_GOAL_SATISFIED |
L'objectif de l'utilisateur doit être atteint. |
USER_GOAL_REJECTED |
L'objectif de l'utilisateur doit être refusé. |
USER_GOAL_IGNORED |
Ignorez l'état de l'objectif de l'utilisateur. |
ScenarioExecutionMode
Mode d'exécution pour les évaluations de scénarios.
| Enums | |
|---|---|
SCENARIO_EXECUTION_MODE_UNSPECIFIED |
Mode d'exécution non spécifié. La valeur par défaut est QUALITY_OPTIMIZED. |
QUALITY_OPTIMIZED |
Mode optimisé pour la qualité. |
SPEED_OPTIMIZED |
Mode optimisé pour la vitesse. |
Résultat
Résultat de l'évaluation ou de l'attente.
| Enums | |
|---|---|
OUTCOME_UNSPECIFIED |
Le résultat de l'évaluation n'est pas spécifié. |
PASS |
L'évaluation/l'attente a été respectée. Dans le cas d'une évaluation, cela signifie que toutes les attentes ont été satisfaites. |
FAIL |
Échec de l'évaluation/de l'attente. Dans le cas d'une évaluation, cela signifie qu'au moins une attente n'a pas été satisfaite. |
SKIPPED |
L'évaluation/l'attente a été ignorée. |
ErrorType
Type d'erreur
| Enums | |
|---|---|
ERROR_TYPE_UNSPECIFIED |
Type d'erreur non spécifié. |
RUNTIME_FAILURE |
Échec lors de l'exécution de l'environnement d'exécution. |
CONVERSATION_RETRIEVAL_FAILURE |
Échec de la récupération de la conversation depuis l'environnement d'exécution CES. |
METRIC_CALCULATION_FAILURE |
Échec du calcul d'une métrique ou d'un résultat. |
EVALUATION_UPDATE_FAILURE |
Échec de la mise à jour de l'évaluation. |
QUOTA_EXHAUSTED |
Le quota a été épuisé. |
USER_SIMULATION_FAILURE |
Échec lors de la simulation de l'utilisateur. |
Type
Type de span. D'autres valeurs pourront être ajoutées à l'avenir.
| Enums | |
|---|---|
TYPE_UNSPECIFIED |
Valeur par défaut. Cette valeur n'est pas utilisée. |
TOOL |
Segment d'appel d'outil. |
USER_CALLBACK |
Portée du rappel utilisateur. |
GUARDRAIL |
Portée du garde-fou. |
LLM |
Portée du LLM. |
BackgroundEnvironment
Environnement audio simulé.
| Enums | |
|---|---|
BACKGROUND_ENVIRONMENT_UNSPECIFIED |
Environnement d'arrière-plan non spécifié. |
CALL_CENTER |
Environnement de centre d'appels. |
TRAFFIC |
Environnement bruyant lié au trafic. |
KIDS_NOISE |
Environnement bruyant pour les enfants. |
CAFE |
Environnement de café. |
ExecutionState
État de l'exécution du résultat de l'évaluation.
| Enums | |
|---|---|
EXECUTION_STATE_UNSPECIFIED |
L'état d'exécution du résultat de l'évaluation n'est pas spécifié. |
QUEUED |
L'exécution du résultat de l'évaluation est mise en file d'attente. |
RUNNING |
L'exécution du résultat de l'évaluation est en cours. |
COMPLETED |
L'exécution du résultat de l'évaluation est terminée. |
ERROR |
L'exécution du résultat de l'évaluation a échoué en raison d'une erreur interne. |
CANCELLED |
L'exécution du résultat de l'évaluation a été annulée. |
ExtraToolCallBehavior
Définit le comportement lorsqu'un appel d'outil supplémentaire est rencontré. Un appel d'outil supplémentaire est un appel d'outil présent dans l'exécution, mais qui ne correspond à aucun appel d'outil dans l'attente de référence.
| Enums | |
|---|---|
EXTRA_TOOL_CALL_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié. La valeur par défaut est "FAIL". |
FAIL |
Échoue l'évaluation si un appel d'outil supplémentaire est rencontré. |
ALLOW |
Autorisez l'appel d'outil supplémentaire. |
AudioEncoding
AudioEncoding spécifie le format d'encodage des données audio.
| Enums | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Encodage audio non spécifié. |
LINEAR16 |
Encodage audio PCM linéaire 16 bits |
MULAW |
Échantillons de 8 bits compressant des échantillons audio 14 bits qui utilisent la norme G.711 PCMU/MULAW. |
ALAW |
Échantillons de 8 bits compressant des échantillons audio 14 bits qui utilisent la norme G.711 PCMU/A-law. |
EvaluationChannel
Canal à évaluer.
| Enums | |
|---|---|
EVALUATION_CHANNEL_UNSPECIFIED |
Canal d'évaluation non spécifié. |
TEXT |
Canal d'évaluation textuel uniquement. |
AUDIO |
Canal d'évaluation audio. |
EvaluationToolCallBehaviour
Configure le comportement d'appel d'outil pour les exécutions d'évaluation.
| Enums | |
|---|---|
EVALUATION_TOOL_CALL_BEHAVIOUR_UNSPECIFIED |
Comportement d'appel d'outil non spécifié. Les appels d'outils réels seront définis par défaut. |
REAL |
Utilisez de vrais appels d'outils. |
FAKE |
Utilisez de faux appels d'outils. |
GoldenRunMethod
Méthode utilisée pour exécuter l'évaluation.
| Enums | |
|---|---|
GOLDEN_RUN_METHOD_UNSPECIFIED |
La méthode d'exécution n'est pas spécifiée. |
STABLE |
Exécutez l'évaluation en tant que relecture stable, où chaque tour est une session unique avec les tours attendus précédents injectés en tant que contexte. |
NAIVE |
Exécutez l'évaluation en tant que relecture naïve, où l'exécution est une session unique sans contexte injecté. |
OutcomeMetadata
Métadonnées sur le résultat de l'évaluation.
| Enums | |
|---|---|
OUTCOME_METADATA_UNSPECIFIED |
Métadonnées de résultat non spécifiées. |
GRACEFUL_HANDOFF |
L'évaluation a permis de transférer la demande à un représentant humain. |
Schéma de sortie
Une évaluation représente toutes les informations nécessaires pour simuler et évaluer un agent.
Évaluation
| Représentation JSON |
|---|
{ "name": string, "displayName": string, "description": string, "tags": [ string ], "evaluationDatasets": [ string ], "createTime": string, "createdBy": string, "updateTime": string, "lastUpdatedBy": string, "evaluationRuns": [ string ], "etag": string, "aggregatedMetrics": { object ( |
| Champs | |
|---|---|
name |
Identifiant. Identifiant unique de cette évaluation. Format : |
displayName |
Obligatoire. Nom à afficher de l'évaluation défini par l'utilisateur. Unique dans une application. |
description |
Facultatif. Description de l'évaluation définie par l'utilisateur. |
tags[] |
Facultatif. Tags définis par l'utilisateur pour catégoriser l'évaluation. |
evaluationDatasets[] |
Uniquement en sortie. Liste des ensembles de données d'évaluation auxquels appartient l'évaluation. Format : |
createTime |
Uniquement en sortie. Horodatage de la création de l'évaluation. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
createdBy |
Uniquement en sortie. Utilisateur qui a créé l'évaluation. |
updateTime |
Uniquement en sortie. Code temporel de la dernière mise à jour de l'évaluation. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
lastUpdatedBy |
Uniquement en sortie. L'utilisateur qui a mis à jour l'évaluation pour la dernière fois. |
evaluationRuns[] |
Uniquement en sortie. Les EvaluationRuns auxquels cette évaluation est associée. |
etag |
Uniquement en sortie. Etag utilisé pour s'assurer que l'objet n'a pas été modifié lors d'une opération de lecture/modification/écriture. Si l'etag est vide, la mise à jour écrasera toutes les modifications simultanées. |
aggregatedMetrics |
Uniquement en sortie. Métriques agrégées pour cette évaluation sur toutes les exécutions. |
lastCompletedResult |
Uniquement en sortie. Le dernier résultat de l'évaluation. |
invalid |
Uniquement en sortie. Indique si l'évaluation n'est pas valide. Cela peut se produire si une évaluation fait référence à un outil, un ensemble d'outils ou un agent qui a été supprimé depuis. |
lastTenResults[] |
Uniquement en sortie. Les 10 derniers résultats d'évaluation pour cette évaluation. Cette valeur n'est renseignée que si include_last_ten_results est défini sur "true" dans ListEvaluationsRequest ou GetEvaluationRequest. |
evaluationMetricsThresholdOverride |
Facultatif. Remplace les seuils de métriques pour cette évaluation spécifique. |
evaluationMetricsConfigOverride |
Facultatif. Remplace la configuration des métriques pour cette évaluation spécifique. |
Champ d'union inputs. Les entrées de l'évaluation inputs ne peuvent être que l'une des suivantes : |
|
golden |
Facultatif. Étapes de référence à évaluer. |
scenario |
Facultatif. Configuration d'un scénario. |
Doré
| Représentation JSON |
|---|
{
"turns": [
{
object ( |
| Champs | |
|---|---|
turns[] |
Obligatoire. Nombre de tours en or requis pour rejouer une conversation en or. Le nombre maximal de tours autorisés est de 100. |
evaluationExpectations[] |
Facultatif. Attentes d'évaluation par rapport auxquelles évaluer la conversation rejouée. Format : |
GoldenTurn
| Représentation JSON |
|---|
{ "steps": [ { object ( |
| Champs | |
|---|---|
steps[] |
Obligatoire. Étapes à suivre pour rejouer une conversation de référence. |
rootSpan |
Facultatif. Portée racine du tour d'or pour le traitement et la gestion des informations audio. L'URI de l'audio doit contenir un fichier audio enregistré avec un taux d'échantillonnage de 16 kHz. |
turnLevelMetricsThresholdsOverride |
Facultatif. Remplacements pour les seuils de métriques au niveau du tour. |
hallucinationMetricBehaviorOverride |
Facultatif. Ignorer le comportement de la métrique d'hallucination au niveau du tour. |
Étape
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union step. Étape à suivre. step ne peut être qu'un des éléments suivants : |
|
userInput |
Facultatif. Entrée utilisateur pour la conversation. |
agentTransfer |
Facultatif. transférer la conversation à un autre agent ; |
expectation |
Facultatif. Exécute une attente pour le tour actuel. |
SessionInput
| Représentation JSON |
|---|
{ "willContinue": boolean, // Union field |
| Champs | |
|---|---|
willContinue |
Facultatif. Indicateur permettant de déterminer si le message actuel est un fragment d'une entrée plus grande dans la session de streaming bidirectionnel. Si ce paramètre est défini sur REMARQUE : Ce champ ne s'applique pas aux entrées audio et DTMF, car elles sont toujours traitées automatiquement en fonction du signal de fin. |
Champ d'union input_type. Type d'entrée. input_type ne peut être qu'un des éléments suivants : |
|
text |
Facultatif. Données textuelles de l'utilisateur final. |
dtmf |
Facultatif. Chiffres DTMF de l'utilisateur final. |
audio |
Facultatif. Données audio de l'utilisateur final. Chaîne encodée en base64. |
toolResponses |
Facultatif. Résultats d'exécution des appels d'outils du client. |
image |
Facultatif. Données d'image de l'utilisateur final. |
blob |
Facultatif. Données blob de l'utilisateur final. |
variables |
Facultatif. Variables contextuelles pour la session, identifiées par leur nom. L'agent CES n'utilisera que les variables déclarées dans l'application. Les variables non reconnues seront toujours envoyées à l'[agent Dialogflow][Agent.RemoteDialogflowAgent] en tant que paramètres de session supplémentaires. |
event |
Facultatif. Saisie d'événement. |
ToolResponses
| Représentation JSON |
|---|
{
"toolResponses": [
{
object ( |
| Champs | |
|---|---|
toolResponses[] |
Facultatif. Liste des résultats d'exécution de l'outil. |
ToolResponse
| Représentation JSON |
|---|
{ "id": string, "displayName": string, "response": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Champs | |
|---|---|
id |
Facultatif. ID correspondant du |
displayName |
Uniquement en sortie. Nom à afficher de l'outil. |
response |
Obligatoire. Résultat de l'exécution de l'outil au format d'objet JSON. Utilisez la clé "output" pour spécifier la réponse de l'outil et la clé "error" pour spécifier les détails de l'erreur (le cas échéant). Si les clés "output" et "error" ne sont pas spécifiées, l'ensemble de la "response" est traité comme le résultat de l'exécution de l'outil. |
parentToolCallId |
Uniquement en sortie. ID de l'appel d'outil qui a déclenché celui-ci, lorsqu'il a été émis par un sous-agent travaillant pour le compte d'un appel parent. Vide pour les appels de premier niveau. Permet à un client de regrouper le travail d'un sous-agent sous l'appel qui l'a déclenché au lieu de rendre chaque étape en tant que frère. |
agentName |
Uniquement en sortie. Nom lisible de l'agent qui a émis cet appel, par exemple "Architecte de contrat". Vide lorsque l'agent racine l'a émis. |
Champ d'union tool_identifier. Identifiant de l'outil qui a été exécuté. Il peut s'agir d'un outil persistant ou d'un outil d'un ensemble d'outils. tool_identifier ne peut être qu'un des éléments suivants : |
|
tool |
Facultatif. Nom de l'outil à exécuter. Format : |
toolsetTool |
Facultatif. Outil de l'ensemble d'outils qui a été exécuté. |
ToolsetTool
| Représentation JSON |
|---|
{ "toolset": string, "toolId": string } |
| Champs | |
|---|---|
toolset |
Obligatoire. Nom de ressource de l'ensemble d'outils à partir duquel cet outil est dérivé. Format : |
toolId |
Facultatif. ID de l'outil permettant de filtrer les outils pour récupérer le schéma. |
Struct
| Représentation JSON |
|---|
{ "fields": { string: value, ... } } |
| Champs | |
|---|---|
fields |
Carte non ordonnée de valeurs typées dynamiquement. Objet contenant une liste de paires |
FieldsEntry
| Représentation JSON |
|---|
{ "key": string, "value": value } |
| Champs | |
|---|---|
key |
|
value |
|
Valeur
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union kind. Type de valeur. kind ne peut être qu'un des éléments suivants : |
|
nullValue |
Représente un |
numberValue |
Représente un nombre JSON. Ne doit pas être |
stringValue |
Représente une chaîne JSON. |
boolValue |
Représente une valeur booléenne JSON (littéral |
structValue |
Représente un objet JSON. |
listValue |
Représente un tableau JSON. |
ListValue
| Représentation JSON |
|---|
{ "values": [ value ] } |
| Champs | |
|---|---|
values[] |
Champ répété de valeurs typées de manière dynamique. |
Image
| Représentation JSON |
|---|
{ "mimeType": string, "data": string } |
| Champs | |
|---|---|
mimeType |
Obligatoire. Type MIME standard IANA des données sources. Les types d'images acceptés sont les suivants : * image/png * image/jpeg * image/webp |
data |
Obligatoire. Octets bruts de l'image. Chaîne encodée en base64. |
Blob
| Représentation JSON |
|---|
{ "mimeType": string, "data": string } |
| Champs | |
|---|---|
mimeType |
Obligatoire. Type MIME standard IANA des données sources. |
data |
Obligatoire. Octets bruts du blob. Chaîne encodée en base64. |
Événement
| Représentation JSON |
|---|
{ "event": string } |
| Champs | |
|---|---|
event |
Obligatoire. Nom de l'événement. |
AgentTransfer
| Représentation JSON |
|---|
{ "targetAgent": string, "displayName": string } |
| Champs | |
|---|---|
targetAgent |
Obligatoire. Agent auquel la conversation est transférée. L'agent prendra le relais à partir de ce moment. Format : |
displayName |
Uniquement en sortie. Nom à afficher de l'agent. |
GoldenExpectation
| Représentation JSON |
|---|
{ "note": string, "skipEvaluation": boolean, "expectationLevelMetricsThresholdsOverride": { object ( |
| Champs | |
|---|---|
note |
Facultatif. Note concernant cette exigence, utile pour les rapports lorsque des vérifications spécifiques échouent. Exemple : "Check_Payment_Tool_Called". |
skipEvaluation |
Facultatif. Si la valeur est définie sur "true", cette attente spécifique ne sera pas évaluée. |
expectationLevelMetricsThresholdsOverride |
Facultatif. Remplace les métriques au niveau de l'étape. |
agentResponseSemanticSimilarityMetricsConfigOverride |
Facultatif. Remplacements pour les métriques de similarité sémantique de agent_response. |
agentResponseHallucinationMetricsConfigOverride |
Facultatif. Remplace les métriques d'hallucination agent_response. |
comparisonType |
Facultatif. Type de comparaison à utiliser pour la vérification des attentes. |
Champ d'union condition. Vérification à effectuer. condition ne peut être qu'un des éléments suivants : |
|
toolCall |
Facultatif. Vérifiez qu'un outil spécifique a été appelé avec les paramètres. |
toolResponse |
Facultatif. Vérifiez qu'un outil spécifique a donné la réponse attendue. |
agentResponse |
Facultatif. Vérifiez que l'agent a répondu correctement. Le rôle "agent" est implicite. |
agentTransfer |
Facultatif. Vérifiez que l'agent a transféré la conversation à un autre agent. |
updatedVariables |
Facultatif. Vérifiez que l'agent a défini les variables de session sur les valeurs attendues. Permet également de capturer les mises à jour des variables d'agent pour les évaluations de référence. |
mockToolResponse |
Facultatif. Réponse de l'outil à simuler, avec les paramètres d'intérêt spécifiés. Tous les paramètres non spécifiés seront générés par le LLM. |
noToolCalls |
Facultatif. Vérifiez qu'aucun outil n'a été appelé pendant ce tour. |
ToolCall
| Représentation JSON |
|---|
{ "id": string, "displayName": string, "args": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Champs | |
|---|---|
id |
Facultatif. Identifiant unique de l'appel d'outil. Si ce champ est renseigné, le client doit renvoyer le résultat de l'exécution avec l'ID correspondant dans |
displayName |
Uniquement en sortie. Nom à afficher de l'outil. |
args |
Facultatif. Paramètres et valeurs d'entrée de l'outil au format d'objet JSON. |
parentToolCallId |
Uniquement en sortie. ID de l'appel d'outil qui a déclenché celui-ci, lorsqu'il a été émis par un sous-agent travaillant pour le compte d'un appel parent. Vide pour les appels de premier niveau. Permet à un client de regrouper le travail d'un sous-agent sous l'appel qui l'a déclenché au lieu de rendre chaque étape en tant que frère. |
agentName |
Uniquement en sortie. Nom lisible de l'agent qui a émis cet appel, par exemple "Architecte de contrat". Vide lorsque l'agent racine l'a émis. |
Champ d'union tool_identifier. Identifiant de l'outil à exécuter. Il peut s'agir d'un outil persistant ou d'un outil d'un ensemble d'outils. tool_identifier ne peut être qu'un des éléments suivants : |
|
tool |
Facultatif. Nom de l'outil à exécuter. Format : |
toolsetTool |
Facultatif. Outil de l'ensemble d'outils à exécuter. |
Message
| Représentation JSON |
|---|
{
"role": string,
"chunks": [
{
object ( |
| Champs | |
|---|---|
role |
Facultatif. Rôle dans la conversation (utilisateur, agent, etc.). |
chunks[] |
Facultatif. Contenu du message sous forme de série de blocs. |
eventTime |
Facultatif. Code temporel de l'envoi ou de la réception du message. Ne doit pas être utilisé si le message fait partie d'un Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
Bloc
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union data. Regroupez les données. data ne peut être qu'un des éléments suivants : |
|
text |
Facultatif. Données textuelles. |
transcript |
Facultatif. Transcription associée à l'élément audio. |
blob |
Facultatif. Données blob. |
payload |
Facultatif. Données de charge utile personnalisées. |
image |
Facultatif. Données d'image. |
toolCall |
Facultatif. Requête d'exécution d'outil. |
toolResponse |
Facultatif. Réponse à l'exécution de l'outil. |
agentTransfer |
Facultatif. Événement de transfert d'agent. |
updatedVariables |
Une structure représente les variables qui ont été mises à jour dans la conversation, avec les noms de variables comme clés. |
defaultVariables |
Une structure représente les variables par défaut au début de la conversation, avec les noms de variables comme clés. |
Horodatage
| Représentation JSON |
|---|
{ "seconds": string, "nanos": integer } |
| Champs | |
|---|---|
seconds |
Représente les secondes de l'heure UTC à partir de l'epoch Unix 1970-01-01T00:00:00Z. La valeur doit être comprise entre -62135596800 et 253402300799 inclus (ce qui correspond à 0001-01-01T00:00:00Z et 9999-12-31T23:59:59Z). |
nanos |
Fractions de secondes non négatives avec une précision de l'ordre de la nanoseconde. Ce champ correspond à la partie en nanosecondes de la durée, et non à une alternative aux secondes. Les valeurs de secondes négatives avec des fractions doivent toujours comporter des valeurs de nanosecondes non négatives comptabilisées dans le temps. La valeur doit être comprise entre 0 et 999 999 999 inclus. |
ExpectationLevelMetricsThresholds
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union
|
|
toolInvocationParameterCorrectnessThreshold |
Facultatif. Seuil de réussite pour la justesse des paramètres d'appel d'outil individuel. Doit être un nombre à virgule flottante compris entre 0 et 1. La valeur par défaut est 1.0. |
SemanticSimilarityMetricsConfig
| Représentation JSON |
|---|
{ "enableSemanticSimilarityMetrics": boolean } |
| Champs | |
|---|---|
enableSemanticSimilarityMetrics |
Facultatif. Indique si les métriques de similarité sémantique doivent être calculées pour l'évaluation. |
HallucinationMetricsConfig
| Représentation JSON |
|---|
{ "enableHallucinationMetrics": boolean } |
| Champs | |
|---|---|
enableHallucinationMetrics |
Facultatif. Indique si les métriques d'hallucination doivent être calculées pour l'évaluation. |
Segment
| Représentation JSON |
|---|
{
"name": string,
"startTime": string,
"endTime": string,
"duration": string,
"attributes": {
object
},
"childSpans": [
{
object ( |
| Champs | |
|---|---|
name |
Uniquement en sortie. Nom du segment. |
startTime |
Uniquement en sortie. Heure de début du segment. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
endTime |
Uniquement en sortie. Heure de fin de l'étendue. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
duration |
Uniquement en sortie. Durée du segment. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
attributes |
Uniquement en sortie. Attributs clé-valeur associés à la portée. |
childSpans[] |
Uniquement en sortie. Les portées enfants imbriquées sous cette portée. |
Durée
| Représentation JSON |
|---|
{ "seconds": string, "nanos": integer } |
| Champs | |
|---|---|
seconds |
Secondes signées de la période. La valeur doit être comprise entre -315 576 000 000 et +315 576 000 000 (inclus). Remarque : Ces limites sont calculées à partir de : 60 s/min * 60 min/h * 24 h/jour * 365,25 jours/an * 10 000 ans |
nanos |
Fractions de secondes signées avec une précision de l'ordre de la nanoseconde pour la durée. Les durées inférieures à une seconde sont représentées par un champ |
TurnLevelMetricsThresholds
| Représentation JSON |
|---|
{ "semanticSimilarityChannel": enum ( |
| Champs | |
|---|---|
semanticSimilarityChannel |
Facultatif. Canal de similarité sémantique à utiliser pour l'évaluation. |
Champ d'union
|
|
semanticSimilaritySuccessThreshold |
Facultatif. Seuil de réussite pour la similarité sémantique. Veuillez saisir un nombre entier compris entre 0 et 4. La valeur par défaut est >= 3. |
Champ d'union
|
|
overallToolInvocationCorrectnessThreshold |
Facultatif. Seuil de réussite pour la correction globale de l'appel d'outil. Doit être un nombre à virgule flottante compris entre 0 et 1. La valeur par défaut est 1.0. |
Scénario
| Représentation JSON |
|---|
{ "task": string, "userFacts": [ { object ( |
| Champs | |
|---|---|
task |
Obligatoire. Tâche à cibler par le scénario. |
userFacts[] |
Facultatif. Faits utilisateur à utiliser par le scénario. |
maxTurns |
Facultatif. Nombre maximal de tours à simuler. La valeur maximale autorisée est de 100. La valeur par défaut est 100. |
rubrics[] |
Obligatoire. Rubriques permettant d'évaluer le scénario. |
scenarioExpectations[] |
Obligatoire. Les ScenarioExpectations permettant d'évaluer la conversation produite par la simulation utilisateur. |
variableOverrides |
Facultatif. Variables / paramètres de session en tant que contexte pour la session, avec les noms de variables comme clés. Les membres de cette structure remplaceront toutes les valeurs par défaut définies par le système. Notez que ces faits sont différents des faits utilisateur, qui sont des faits connus de l'utilisateur. Les variables sont des paramètres connus de l'agent, c'est-à-dire le numéro de téléphone transmis par le système de téléphonie. |
taskCompletionBehavior |
Facultatif. Obsolète. Utilisez plutôt user_goal_behavior. |
userGoalBehavior |
Facultatif. Comportement attendu de l'objectif utilisateur. |
evaluationExpectations[] |
Facultatif. Attentes d'évaluation pour évaluer la conversation produite par la simulation. Format : |
scenarioExecutionMode |
Facultatif. Mode d'exécution pour les évaluations de scénarios. |
UserFact
| Représentation JSON |
|---|
{ "name": string, "value": string } |
| Champs | |
|---|---|
name |
Obligatoire. Nom du fait utilisateur. |
value |
Obligatoire. Valeur du fait utilisateur. |
ScenarioExpectation
| Représentation JSON |
|---|
{ // Union field |
| Champs | |
|---|---|
Champ d'union expectation. L'attente d'évaluer la conversation produite par la simulation. expectation ne peut être qu'un des éléments suivants : |
|
toolExpectation |
Facultatif. Paire d'appel et de réponse de l'outil à évaluer. |
agentResponse |
Facultatif. Réponse de l'agent à évaluer. |
ToolExpectation
| Représentation JSON |
|---|
{ "expectedToolCall": { object ( |
| Champs | |
|---|---|
expectedToolCall |
Obligatoire. Appel d'outil attendu, avec les paramètres d'intérêt spécifiés. Tous les paramètres non spécifiés seront générés par le LLM. |
mockToolResponse |
Obligatoire. Réponse de l'outil à simuler, avec les paramètres d'intérêt spécifiés. Tous les paramètres non spécifiés seront générés par le LLM. |
AggregatedMetrics
| Représentation JSON |
|---|
{
"metricsByAppVersion": [
{
object ( |
| Champs | |
|---|---|
metricsByAppVersion[] |
Uniquement en sortie. Métriques agrégées, regroupées par ID de version de l'application. |
MetricsByAppVersion
| Représentation JSON |
|---|
{ "appVersionId": string, "toolMetrics": [ { object ( |
| Champs | |
|---|---|
appVersionId |
Uniquement en sortie. ID de version de l'application. |
toolMetrics[] |
Uniquement en sortie. Métriques pour chaque outil de cette version de l'application. |
semanticSimilarityMetrics[] |
Uniquement en sortie. Métriques de similarité sémantique dans cette version de l'application. |
hallucinationMetrics[] |
Uniquement en sortie. Métriques concernant les hallucinations dans cette version de l'application. |
toolCallLatencyMetrics[] |
Uniquement en sortie. Métriques pour la latence des appels d'outils dans cette version de l'application. |
turnLatencyMetrics[] |
Uniquement en sortie. Métriques pour la latence des tours dans cette version de l'application. |
passCount |
Uniquement en sortie. Nombre de fois où l'évaluation a été réussie. |
failCount |
Uniquement en sortie. Nombre d'échecs de l'évaluation. |
metricsByTurn[] |
Uniquement en sortie. Métriques agrégées par tour dans cette version de l'application. |
ToolMetrics
| Représentation JSON |
|---|
{ "tool": string, "passCount": integer, "failCount": integer } |
| Champs | |
|---|---|
tool |
Uniquement en sortie. Nom de l'outil. |
passCount |
Uniquement en sortie. Nombre de fois où l'outil a réussi. |
failCount |
Uniquement en sortie. Nombre d'échecs de l'outil. |
SemanticSimilarityMetrics
| Représentation JSON |
|---|
{ "score": number } |
| Champs | |
|---|---|
score |
Uniquement en sortie. Score moyen de similarité sémantique (de 0 à 4). |
HallucinationMetrics
| Représentation JSON |
|---|
{ "score": number } |
| Champs | |
|---|---|
score |
Uniquement en sortie. Score moyen d'hallucination (de 0 à 1). |
ToolCallLatencyMetrics
| Représentation JSON |
|---|
{ "tool": string, "averageLatency": string } |
| Champs | |
|---|---|
tool |
Uniquement en sortie. Nom de l'outil. |
averageLatency |
Uniquement en sortie. Latence moyenne des appels d'outils. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
TurnLatencyMetrics
| Représentation JSON |
|---|
{ "averageLatency": string } |
| Champs | |
|---|---|
averageLatency |
Uniquement en sortie. Latence moyenne des tours. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
MetricsByTurn
| Représentation JSON |
|---|
{ "turnIndex": integer, "toolMetrics": [ { object ( |
| Champs | |
|---|---|
turnIndex |
Uniquement en sortie. Index du tour (basé sur 0). |
toolMetrics[] |
Uniquement en sortie. Métriques pour chaque outil de ce tour. |
semanticSimilarityMetrics[] |
Uniquement en sortie. Métriques de similarité sémantique pour ce tour. |
hallucinationMetrics[] |
Uniquement en sortie. Métriques pour l'hallucination au cours de ce tour. |
toolCallLatencyMetrics[] |
Uniquement en sortie. Métriques de latence des appels d'outils au cours de ce tour. |
turnLatencyMetrics[] |
Uniquement en sortie. Métriques de latence de tour dans ce tour. |
EvaluationResult
| Représentation JSON |
|---|
{ "name": string, "displayName": string, "createTime": string, "evaluationStatus": enum ( |
| Champs | |
|---|---|
name |
Identifiant. Identifiant unique du résultat de l'évaluation. Format : |
displayName |
Obligatoire. Nom à afficher du résultat de l'évaluation. Unique dans une évaluation. Par défaut, il se présente au format suivant : " |
createTime |
Uniquement en sortie. Code temporel de la création du résultat de l'évaluation. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
evaluationStatus |
Uniquement en sortie. Résultat de l'évaluation. N'est renseigné que si execution_state est défini sur "COMPLETE". |
evaluationRun |
Uniquement en sortie. Exécution de l'évaluation ayant généré ce résultat. Format : |
persona |
Uniquement en sortie. Personnalité utilisée pour générer la conversation pour le résultat de l'évaluation. |
errorInfo |
Uniquement en sortie. Informations sur les erreurs liées au résultat de l'évaluation. |
error |
Uniquement en sortie. Obsolète : utilisez plutôt |
initiatedBy |
Uniquement en sortie. Utilisateur ayant lancé l'exécution de l'évaluation qui a généré ce résultat. |
appVersion |
Uniquement en sortie. Version de l'application utilisée pour générer la conversation ayant abouti à ce résultat. Format : |
appVersionDisplayName |
Uniquement en sortie. Nom à afficher du |
changelog |
Uniquement en sortie. Journal des modifications de la version de l'application par rapport à laquelle l'évaluation a été exécutée. Cette valeur est renseignée si l'utilisateur exécute l'évaluation sur la dernière version ou le brouillon. |
changelogCreateTime |
Uniquement en sortie. Heure de création du journal des modifications de la version de l'application par rapport à laquelle l'évaluation a été exécutée. Cette valeur est renseignée si l'utilisateur exécute l'évaluation sur la dernière version ou le brouillon. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
executionState |
Uniquement en sortie. État de l'exécution du résultat de l'évaluation. |
evaluationMetricsThresholds |
Uniquement en sortie. Seuils d'évaluation pour le résultat. |
config |
Uniquement en sortie. Configuration utilisée lors de l'exécution de l'évaluation ayant généré ce résultat. |
goldenRunMethod |
Uniquement en sortie. Méthode utilisée pour exécuter l'évaluation de référence. |
rootSpan |
Uniquement en sortie. Portée racine de l'exécution de l'évaluation, qui inclut des informations sur chaque étape de l'évaluation. |
outcomeMetadata |
Uniquement en sortie. Métadonnées de résultat de l'évaluation. N'est renseigné que si execution_state est défini sur "COMPLETE". |
Champ d'union result. Résultat de l'évaluation. N'est renseigné que lorsque l'état d'exécution est "COMPLETED". result ne peut être qu'un des éléments suivants : |
|
goldenResult |
Uniquement en sortie. Résultat d'une évaluation de référence. |
scenarioResult |
Uniquement en sortie. Résultat d'une évaluation de scénario. |
GoldenResult
| Représentation JSON |
|---|
{ "turnReplayResults": [ { object ( |
| Champs | |
|---|---|
turnReplayResults[] |
Uniquement en sortie. Résultat de l'exécution de chaque tour de la conversation de référence. |
evaluationExpectationResults[] |
Uniquement en sortie. les résultats attendus de l'évaluation. |
TurnReplayResult
| Représentation JSON |
|---|
{ "conversation": string, "expectationOutcome": [ { object ( |
| Champs | |
|---|---|
conversation |
Uniquement en sortie. Conversation générée pour ce tour. |
expectationOutcome[] |
Uniquement en sortie. Le résultat de chaque attente. |
hallucinationResult |
Uniquement en sortie. Résultat de la vérification des hallucinations. |
toolInvocationScore |
Uniquement en sortie. Obsolète. Utilisez plutôt OverallToolInvocationResult. |
turnLatency |
Uniquement en sortie. Durée du tour. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
toolCallLatencies[] |
Uniquement en sortie. Latence de chaque appel d'outil dans le tour. |
semanticSimilarityResult |
Uniquement en sortie. Résultat de la vérification de la similarité sémantique. |
overallToolInvocationResult |
Uniquement en sortie. Résultat de la vérification globale de l'appel d'outil. |
errorInfo |
Uniquement en sortie. Informations sur l'erreur qui s'est produite lors de ce tour. |
spanLatencies[] |
Uniquement en sortie. Latence des spans dans le tour. |
Champ d'union
|
|
toolOrderedInvocationScore |
Uniquement en sortie. Score global d'invocation d'outil pour ce tour. Indique le pourcentage global d'outils du tour attendu qui ont été réellement appelés dans l'ordre attendu. |
GoldenExpectationOutcome
| Représentation JSON |
|---|
{ "expectation": { object ( |
| Champs | |
|---|---|
expectation |
Uniquement en sortie. L'attente qui a été évaluée. |
outcome |
Uniquement en sortie. Résultat attendu. |
semanticSimilarityResult |
Uniquement en sortie. Résultat de la vérification de la similarité sémantique. |
toolInvocationResult |
Uniquement en sortie. Résultat de la vérification de l'appel d'outil. |
Champ d'union result. Résultat de l'attente. result ne peut être qu'un des éléments suivants : |
|
observedToolCall |
Uniquement en sortie. Résultat attendu de l'appel d'outil. |
observedToolResponse |
Uniquement en sortie. Résultat de l'attente de réponse de l'outil. |
observedAgentResponse |
Uniquement en sortie. Résultat de l'attente de réponse de l'agent. |
observedAgentTransfer |
Uniquement en sortie. Résultat de l'attente de transfert de l'agent. |
observedPayload |
Uniquement en sortie. Charge utile personnalisée observée. Il n'y a aucune attente concernant les charges utiles personnalisées. Elle n'est utilisée que pour le calcul des métriques. Le résultat est toujours "SKIPPED" (IGNORÉ). |
SemanticSimilarityResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, "outcome": enum ( |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 4 : entièrement cohérent Score 3 : principalement cohérent Score 2 : partiellement cohérent (omissions mineures) Score 1 : largement incohérent (omissions majeures) Score 0 : complètement incohérent / contradictoire |
explanation |
Uniquement en sortie. Explication du score de similarité sémantique. |
outcome |
Uniquement en sortie. Résultat de la vérification de la similarité sémantique. Pour ce faire, le score est comparé à semantic_similarity_success_threshold. Si le score est égal ou supérieur au seuil, le résultat est "RÉUSSITE". Sinon, le résultat sera FAIL. |
Champ d'union
|
|
score |
Uniquement en sortie. Score de similarité sémantique. Peut être égal à 0, 1, 2, 3 ou 4. |
ToolInvocationResult
| Représentation JSON |
|---|
{ "outcome": enum ( |
| Champs | |
|---|---|
outcome |
Uniquement en sortie. Résultat de la vérification de l'appel d'outil. Pour ce faire, le paramètre "parameter_correctness_score" est comparé au seuil. Si le score est égal ou supérieur au seuil, le résultat est "RÉUSSITE". Sinon, le résultat sera FAIL. |
explanation |
Uniquement en sortie. Explication en texte libre du résultat de l'appel d'outil. |
Champ d'union
|
|
parameterCorrectnessScore |
Uniquement en sortie. Score d'exactitude du paramètre d'invocation d'outil. Indique le pourcentage de paramètres de l'appel d'outil attendu qui étaient également présents dans l'appel d'outil réel. |
HallucinationResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 1 : Justifié Score 0 : Non justifié Score -1 : Aucune affirmation à évaluer |
explanation |
Uniquement en sortie. Explication du score d'hallucination. |
Champ d'union
|
|
score |
Uniquement en sortie. Score d'hallucination. Valeurs possibles : -1, 0 ou 1. |
ToolCallLatency
| Représentation JSON |
|---|
{ "tool": string, "displayName": string, "startTime": string, "endTime": string, "executionLatency": string } |
| Champs | |
|---|---|
tool |
Uniquement en sortie. Nom de l'outil exécuté. Format : |
displayName |
Uniquement en sortie. Nom à afficher de l'outil. |
startTime |
Uniquement en sortie. Heure de début de l'exécution de l'appel d'outil. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
endTime |
Uniquement en sortie. Heure de fin de l'exécution de l'appel d'outil. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
executionLatency |
Uniquement en sortie. Latence de l'exécution de l'appel d'outil. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
OverallToolInvocationResult
| Représentation JSON |
|---|
{ "outcome": enum ( |
| Champs | |
|---|---|
outcome |
Uniquement en sortie. Résultat de la vérification de l'appel d'outil. Cette valeur est déterminée en comparant tool_invocation_score au seuil overall_tool_invocation_correctness_threshold. Si le score est égal ou supérieur au seuil, le résultat est "RÉUSSITE". Sinon, le résultat sera FAIL. |
Champ d'union
|
|
toolInvocationScore |
Score global d'appel d'outil pour ce tour. Indique le pourcentage global d'outils de la réponse attendue qui ont été réellement appelés. |
EvaluationErrorInfo
| Représentation JSON |
|---|
{
"errorType": enum ( |
| Champs | |
|---|---|
errorType |
Uniquement en sortie. Type d'erreur. |
errorMessage |
Uniquement en sortie. Message d'erreur. |
sessionId |
Uniquement en sortie. ID de session de la conversation à l'origine de l'erreur. |
userFacingErrorMessage |
Uniquement en sortie. Message d'erreur visible par l'utilisateur. |
SpanLatency
| Représentation JSON |
|---|
{ "type": enum ( |
| Champs | |
|---|---|
type |
Uniquement en sortie. Type de span. |
displayName |
Uniquement en sortie. Nom à afficher du segment. S'applique aux étendues d'outils et de garde-fous. |
startTime |
Uniquement en sortie. Heure de début du segment. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
endTime |
Uniquement en sortie. Heure de fin du segment. Utilise la norme RFC 3339, où la sortie générée utilise toujours le format UTC (indiqué par "Z" pour le temps universel coordonné) avec des secondes fractionnaires de 0, 3, 6 ou 9 chiffres décimaux. Des décalages horaires autres que "Z" (UTC) sont également acceptés. Exemples : |
executionLatency |
Uniquement en sortie. Latence du segment. Durée en secondes avec neuf chiffres au maximum après la virgule et se terminant par " |
Champ d'union identifier. Identifiant de l'élément spécifique en fonction de son type. identifier ne peut être qu'un des éléments suivants : |
|
resource |
Uniquement en sortie. Nom de ressource des étendues de garde-fou ou d'outil. |
toolset |
Uniquement en sortie. Identifiant de l'outil dans l'ensemble d'outils. |
model |
Uniquement en sortie. Nom du segment LLM. |
callback |
Uniquement en sortie. Nom de la portée du rappel utilisateur. |
EvaluationExpectationResult
| Représentation JSON |
|---|
{
"evaluationExpectation": string,
"prompt": string,
"outcome": enum ( |
| Champs | |
|---|---|
evaluationExpectation |
Uniquement en sortie. L'attente d'évaluation. Format : |
prompt |
Uniquement en sortie. Requête utilisée pour l'évaluation. |
outcome |
Uniquement en sortie. Résultat attendu de l'évaluation. |
explanation |
Uniquement en sortie. Explication du résultat. |
ScenarioResult
| Représentation JSON |
|---|
{ "conversation": string, "task": string, "userFacts": [ { object ( |
| Champs | |
|---|---|
conversation |
Uniquement en sortie. Conversation générée dans le scénario. |
task |
Uniquement en sortie. Tâche utilisée lors de l'exécution du scénario pour ce résultat. |
userFacts[] |
Uniquement en sortie. Faits sur l'utilisateur utilisés par le scénario pour ce résultat. |
expectationOutcomes[] |
Uniquement en sortie. Le résultat de chaque attente. |
rubricOutcomes[] |
Uniquement en sortie. Résultat de la grille d'évaluation. |
hallucinationResult[] |
Uniquement en sortie. Résultat de la vérification des hallucinations. Il y aura un résultat d'hallucination pour chaque tour de conversation. |
taskCompletionResult |
Uniquement en sortie. Résultat de la vérification de l'exécution de la tâche. |
toolCallLatencies[] |
Uniquement en sortie. Latence de l'exécution de chaque appel d'outil dans la conversation. |
userGoalSatisfactionResult |
Uniquement en sortie. Résultat de la vérification de la satisfaction de l'objectif de l'utilisateur. |
spanLatencies[] |
Uniquement en sortie. Latence des portées dans la conversation. |
evaluationExpectationResults[] |
Uniquement en sortie. les résultats attendus de l'évaluation. |
Champ d'union
|
|
allExpectationsSatisfied |
Uniquement en sortie. Indique si toutes les attentes ont été satisfaites pour ce tour. |
Champ d'union
|
|
taskCompleted |
Uniquement en sortie. Indique si la tâche a été effectuée pour ce tour. Il s'agit d'une combinaison de toutes les attentes satisfaites, de l'absence d'hallucinations et de la satisfaction de l'objectif de l'utilisateur. |
ScenarioExpectationOutcome
| Représentation JSON |
|---|
{ "expectation": { object ( |
| Champs | |
|---|---|
expectation |
Uniquement en sortie. L'attente qui a été évaluée. |
outcome |
Uniquement en sortie. Résultat de ScenarioExpectation. |
Champ d'union result. Résultat de l'attente. result ne peut être qu'un des éléments suivants : |
|
observedToolCall |
Uniquement en sortie. Appel d'outil observé. |
observedAgentResponse |
Uniquement en sortie. Réponse de l'agent observée. |
ObservedToolCall
| Représentation JSON |
|---|
{ "toolCall": { object ( |
| Champs | |
|---|---|
toolCall |
Uniquement en sortie. Appel d'outil observé. |
toolResponse |
Uniquement en sortie. Réponse de l'outil observée. |
ScenarioRubricOutcome
| Représentation JSON |
|---|
{ "rubric": string, "scoreExplanation": string, // Union field |
| Champs | |
|---|---|
rubric |
Uniquement en sortie. Grille d'évaluation utilisée pour évaluer la conversation. |
scoreExplanation |
Uniquement en sortie. Réponse de l'évaluateur à la grille d'évaluation. |
Champ d'union
|
|
score |
Uniquement en sortie. Score de la conversation par rapport à la grille d'évaluation. |
TaskCompletionResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 1 : tâche terminée Score 0 : tâche non terminée Score -1 : objectif de l'utilisateur non défini |
explanation |
Uniquement en sortie. Explication du score d'accomplissement des tâches. |
Champ d'union
|
|
score |
Uniquement en sortie. Score d'exécution de la tâche. Valeurs possibles : -1, 0 ou 1 |
UserGoalSatisfactionResult
| Représentation JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Champs | |
|---|---|
label |
Uniquement en sortie. Libellé associé à chaque score. Score 2 : Transfert fluide Score 1 : Tâche utilisateur effectuée Score 0 : Tâche utilisateur non effectuée Score -1 : Tâche utilisateur non spécifiée |
explanation |
Uniquement en sortie. Explication du score de satisfaction des tâches utilisateur. |
Champ d'union
|
|
score |
Uniquement en sortie. Score de satisfaction de l'utilisateur concernant la tâche. Valeurs possibles : -1, 0, 1, 2. |
EvaluationPersona
| Représentation JSON |
|---|
{
"name": string,
"description": string,
"displayName": string,
"personality": string,
"speechConfig": {
object ( |
| Champs | |
|---|---|
name |
Obligatoire. Identifiant unique de la persona. Format : |
description |
Facultatif. Description du persona. |
displayName |
Obligatoire. Nom à afficher de la persona. Unique dans une application. |
personality |
Obligatoire. Instruction indiquant à l'agent comment se comporter lors de l'évaluation. |
speechConfig |
Facultatif. Configuration de la voix de la persona (paramètres TTS). |
SpeechConfig
| Représentation JSON |
|---|
{
"speakingRate": number,
"environment": enum ( |
| Champs | |
|---|---|
speakingRate |
Facultatif. Vitesse d'élocution. 1.0 est la valeur normale. Une valeur faible (par exemple, 0,8) indique une vitesse lente, tandis qu'une valeur élevée (par exemple, 1,5) indique une vitesse rapide. Utile pour tester la façon dont l'agent gère les personnes qui parlent vite. |
environment |
Facultatif. Environnement audio simulé. |
voiceId |
Facultatif. Identifiant/accent de voix spécifique à utiliser. Exemple : "en-US-Wavenet-D" ou "en-GB-Standard-A" |
État
| Représentation JSON |
|---|
{ "code": integer, "message": string, "details": [ { "@type": string, field1: ..., ... } ] } |
| Champs | |
|---|---|
code |
Code d'état, qui doit être une valeur d'énumération de |
message |
Message d'erreur destiné au développeur, qui doit être en anglais. Tout message d'erreur destiné aux utilisateurs doit être localisé et envoyé dans le champ |
details[] |
Liste de messages comportant les détails de l'erreur. Il existe un ensemble commun de types de message utilisable par les API. Objet contenant des champs d'un type arbitraire. Un champ supplémentaire |
Tous
| Représentation JSON |
|---|
{ "typeUrl": string, "value": string } |
| Champs | |
|---|---|
typeUrl |
Identifie le type du message Protobuf sérialisé avec une référence URI composée d'un préfixe se terminant par une barre oblique et du nom de type complet. Exemple : type.googleapis.com/google.protobuf.StringValue Cette chaîne doit contenir au moins un caractère Le préfixe est arbitraire et les implémentations Protobuf sont censées supprimer tout ce qui précède le dernier Toutes les chaînes d'URL de type doivent être des références URI valides, avec la restriction supplémentaire (pour le format texte) que le contenu de la référence ne doit comporter que des caractères alphanumériques, des séquences d'échappement encodées en pourcentage et des caractères de l'ensemble suivant (sans les accents graves extérieurs) : Dans la conception d'origine de |
value |
Contient une sérialisation Protobuf du type décrit par type_url. Chaîne encodée en base64. |
EvaluationMetricsThresholds
| Représentation JSON |
|---|
{ "goldenEvaluationMetricsThresholds": { object ( |
| Champs | |
|---|---|
goldenEvaluationMetricsThresholds |
Facultatif. Seuils des métriques d'évaluation privilégiées. |
hallucinationMetricBehavior |
Facultatif. Obsolète : utilisez plutôt |
goldenHallucinationMetricBehavior |
Facultatif. Comportement de la métrique d'hallucination pour les évaluations de référence. |
scenarioHallucinationMetricBehavior |
Facultatif. Comportement de la métrique d'hallucination pour les évaluations de scénarios. |
GoldenEvaluationMetricsThresholds
| Représentation JSON |
|---|
{ "turnLevelMetricsThresholds": { object ( |
| Champs | |
|---|---|
turnLevelMetricsThresholds |
Facultatif. Seuils des métriques au niveau du tour. |
expectationLevelMetricsThresholds |
Facultatif. Seuils des métriques de niveau d'attente. |
toolMatchingSettings |
Facultatif. Paramètres de correspondance de l'outil. Un appel d'outil supplémentaire est un appel d'outil présent dans l'exécution, mais qui ne correspond à aucun appel d'outil dans l'attente de référence. |
ToolMatchingSettings
| Représentation JSON |
|---|
{
"extraToolCallBehavior": enum ( |
| Champs | |
|---|---|
extraToolCallBehavior |
Facultatif. Comportement pour les appels d'outils supplémentaires. La valeur par défaut est "FAIL". |
EvaluationConfig
| Représentation JSON |
|---|
{ "inputAudioConfig": { object ( |
| Champs | |
|---|---|
inputAudioConfig |
Facultatif. Configuration pour le traitement de l'entrée audio. |
outputAudioConfig |
Facultatif. Configuration pour générer le contenu audio de sortie. |
evaluationChannel |
Facultatif. Canal à évaluer. |
toolCallBehaviour |
Facultatif. Indique si l'évaluation doit utiliser de vrais appels d'outils ou de faux outils. |
InputAudioConfig
| Représentation JSON |
|---|
{
"audioEncoding": enum ( |
| Champs | |
|---|---|
audioEncoding |
Obligatoire. Encodage des données audio d'entrée. |
sampleRateHertz |
Obligatoire. Taux d'échantillonnage (en hertz) des données audio d'entrée. |
noiseSuppressionLevel |
Facultatif. Indique si la suppression du bruit doit être activée pour l'entrée audio. Les valeurs disponibles sont "low", "moderate", "high" et "very_high". |
OutputAudioConfig
| Représentation JSON |
|---|
{
"audioEncoding": enum ( |
| Champs | |
|---|---|
audioEncoding |
Obligatoire. Encodage des données audio de sortie. |
sampleRateHertz |
Obligatoire. Taux d'échantillonnage (en hertz) des données audio de sortie. |
EvaluationMetricsConfig
| Représentation JSON |
|---|
{ "goldenMetricsConfig": { object ( |
| Champs | |
|---|---|
goldenMetricsConfig |
Facultatif. Configuration des métriques clés pour l'évaluation. |
scenarioMetricsConfig |
Facultatif. Configuration des métriques de scénario pour l'évaluation. |
GoldenMetricsConfig
| Représentation JSON |
|---|
{ "semanticSimilarityMetricsConfig": { object ( |
| Champs | |
|---|---|
semanticSimilarityMetricsConfig |
Facultatif. Configuration globale pour les métriques de similarité sémantique. |
toolCorrectnessMetricsConfig |
Facultatif. Configuration des métriques d'exactitude de l'outil au niveau du tour. |
stepToolCorrectnessMetricsConfig |
Facultatif. Configuration des métriques d'exactitude des outils au niveau des étapes. |
ToolCorrectnessMetricsConfig
| Représentation JSON |
|---|
{ "enableToolCorrectnessMetrics": boolean } |
| Champs | |
|---|---|
enableToolCorrectnessMetrics |
Facultatif. Indique si les métriques d'exactitude des outils doivent être calculées pour l'évaluation. |
ScenarioMetricsConfig
| Représentation JSON |
|---|
{ "userGoalMetMetricsConfig": { object ( |
| Champs | |
|---|---|
userGoalMetMetricsConfig |
Facultatif. Configuration des métriques "Objectif utilisateur atteint". |
expectationsMetMetricsConfig |
Facultatif. Configuration des métriques de niveau d'attente. |
UserGoalMetMetricsConfig
| Représentation JSON |
|---|
{ "enableUserGoalMetMetrics": boolean } |
| Champs | |
|---|---|
enableUserGoalMetMetrics |
Facultatif. Indique si les métriques sur les objectifs utilisateur atteints doivent être calculées pour l'évaluation. |
ExpectationsMetMetricsConfig
| Représentation JSON |
|---|
{ "enableExpectationsMetMetrics": boolean } |
| Champs | |
|---|---|
enableExpectationsMetMetrics |
Facultatif. Indique si les métriques de niveau d'attente doivent être calculées pour l'évaluation. |
NullValue
Représente un null JSON.
NullValue est une sentinelle qui utilise une énumération avec une seule valeur pour représenter la valeur nulle de l'union de type Value.
Un champ de type NullValue avec une valeur autre que 0 est considéré comme non valide. La plupart des sérialiseurs ProtoJSON émettent un Value avec un null_value défini comme null JSON, quelle que soit la valeur entière, et effectuent donc un aller-retour vers une valeur 0.
| Enums | |
|---|---|
NULL_VALUE |
Valeur nulle. |
ComparisonType
Types de comparaison acceptés pour vérifier la réponse de l'agent.
| Enums | |
|---|---|
COMPARISON_TYPE_UNSPECIFIED |
Type de comparaison non spécifié. Le comportement par défaut est SEMANTIC_SIMILARITY pour les réponses de l'agent et les appels d'outils. |
EQUALS |
Correspondance exacte de chaîne. |
CONTAINS |
Correspondance de sous-chaîne (vérifie si la chaîne attendue est contenue dans la réponse réelle). |
SEMANTIC_SIMILARITY |
Correspondance de similarité sémantique (évalue la similarité de sens à l'aide d'un LLM). |
SemanticSimilarityChannel
Canal de similarité sémantique à utiliser.
| Enums | |
|---|---|
SEMANTIC_SIMILARITY_CHANNEL_UNSPECIFIED |
Métrique non spécifiée. La valeur par défaut est TEXT. |
TEXT |
Utilisez la similarité sémantique du texte. |
AUDIO |
Utilisez la similarité sémantique audio. |
HallucinationMetricBehavior
Comportement de la métrique d'hallucination. Quel que soit le comportement, la métrique sera toujours calculée. La différence est que, lorsqu'elle est désactivée, la métrique n'est pas utilisée pour calculer le score d'évaluation global.
| Enums | |
|---|---|
HALLUCINATION_METRIC_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié de la métrique d'hallucination. |
DISABLED |
Désactivez la métrique d'hallucination. |
ENABLED |
Activez la métrique d'hallucination. |
TaskCompletionBehavior
Comportement attendu de la tâche utilisateur. Il permet de déterminer si le scénario est réussi.
| Enums | |
|---|---|
TASK_COMPLETION_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié. La valeur par défaut est TASK_SATISFIED. |
TASK_SATISFIED |
La tâche de l'utilisateur doit être effectuée avec succès. |
TASK_REJECTED |
La tâche de l'utilisateur doit être refusée. |
UserGoalBehavior
Comportement attendu de l'objectif utilisateur. Il permet de déterminer si le scénario est réussi.
| Enums | |
|---|---|
USER_GOAL_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié. La valeur par défaut est USER_GOAL_SATISFIED. |
USER_GOAL_SATISFIED |
L'objectif de l'utilisateur doit être atteint. |
USER_GOAL_REJECTED |
L'objectif de l'utilisateur doit être refusé. |
USER_GOAL_IGNORED |
Ignorez l'état de l'objectif de l'utilisateur. |
ScenarioExecutionMode
Mode d'exécution pour les évaluations de scénarios.
| Enums | |
|---|---|
SCENARIO_EXECUTION_MODE_UNSPECIFIED |
Mode d'exécution non spécifié. La valeur par défaut est QUALITY_OPTIMIZED. |
QUALITY_OPTIMIZED |
Mode optimisé pour la qualité. |
SPEED_OPTIMIZED |
Mode optimisé pour la vitesse. |
Résultat
Résultat de l'évaluation ou de l'attente.
| Enums | |
|---|---|
OUTCOME_UNSPECIFIED |
Le résultat de l'évaluation n'est pas spécifié. |
PASS |
L'évaluation/l'attente a été respectée. Dans le cas d'une évaluation, cela signifie que toutes les attentes ont été satisfaites. |
FAIL |
Échec de l'évaluation/de l'attente. Dans le cas d'une évaluation, cela signifie qu'au moins une attente n'a pas été satisfaite. |
SKIPPED |
L'évaluation/l'attente a été ignorée. |
ErrorType
Type d'erreur
| Enums | |
|---|---|
ERROR_TYPE_UNSPECIFIED |
Type d'erreur non spécifié. |
RUNTIME_FAILURE |
Échec lors de l'exécution de l'environnement d'exécution. |
CONVERSATION_RETRIEVAL_FAILURE |
Échec de la récupération de la conversation depuis l'environnement d'exécution CES. |
METRIC_CALCULATION_FAILURE |
Échec du calcul d'une métrique ou d'un résultat. |
EVALUATION_UPDATE_FAILURE |
Échec de la mise à jour de l'évaluation. |
QUOTA_EXHAUSTED |
Le quota a été épuisé. |
USER_SIMULATION_FAILURE |
Échec lors de la simulation de l'utilisateur. |
Type
Type de span. D'autres valeurs pourront être ajoutées à l'avenir.
| Enums | |
|---|---|
TYPE_UNSPECIFIED |
Valeur par défaut. Cette valeur n'est pas utilisée. |
TOOL |
Segment d'appel d'outil. |
USER_CALLBACK |
Portée du rappel utilisateur. |
GUARDRAIL |
Portée du garde-fou. |
LLM |
Portée du LLM. |
BackgroundEnvironment
Environnement audio simulé.
| Enums | |
|---|---|
BACKGROUND_ENVIRONMENT_UNSPECIFIED |
Environnement d'arrière-plan non spécifié. |
CALL_CENTER |
Environnement de centre d'appels. |
TRAFFIC |
Environnement bruyant lié au trafic. |
KIDS_NOISE |
Environnement bruyant pour les enfants. |
CAFE |
Environnement de café. |
ExecutionState
État de l'exécution du résultat de l'évaluation.
| Enums | |
|---|---|
EXECUTION_STATE_UNSPECIFIED |
L'état d'exécution du résultat de l'évaluation n'est pas spécifié. |
QUEUED |
L'exécution du résultat de l'évaluation est mise en file d'attente. |
RUNNING |
L'exécution du résultat de l'évaluation est en cours. |
COMPLETED |
L'exécution du résultat de l'évaluation est terminée. |
ERROR |
L'exécution du résultat de l'évaluation a échoué en raison d'une erreur interne. |
CANCELLED |
L'exécution du résultat de l'évaluation a été annulée. |
ExtraToolCallBehavior
Définit le comportement lorsqu'un appel d'outil supplémentaire est rencontré. Un appel d'outil supplémentaire est un appel d'outil présent dans l'exécution, mais qui ne correspond à aucun appel d'outil dans l'attente de référence.
| Enums | |
|---|---|
EXTRA_TOOL_CALL_BEHAVIOR_UNSPECIFIED |
Comportement non spécifié. La valeur par défaut est "FAIL". |
FAIL |
Échoue l'évaluation si un appel d'outil supplémentaire est rencontré. |
ALLOW |
Autorisez l'appel d'outil supplémentaire. |
AudioEncoding
AudioEncoding spécifie le format d'encodage des données audio.
| Enums | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Encodage audio non spécifié. |
LINEAR16 |
Encodage audio PCM linéaire 16 bits |
MULAW |
Échantillons de 8 bits compressant des échantillons audio 14 bits qui utilisent la norme G.711 PCMU/MULAW. |
ALAW |
Échantillons de 8 bits compressant des échantillons audio 14 bits qui utilisent la norme G.711 PCMU/A-law. |
EvaluationChannel
Canal à évaluer.
| Enums | |
|---|---|
EVALUATION_CHANNEL_UNSPECIFIED |
Canal d'évaluation non spécifié. |
TEXT |
Canal d'évaluation textuel uniquement. |
AUDIO |
Canal d'évaluation audio. |
EvaluationToolCallBehaviour
Configure le comportement d'appel d'outil pour les exécutions d'évaluation.
| Enums | |
|---|---|
EVALUATION_TOOL_CALL_BEHAVIOUR_UNSPECIFIED |
Comportement d'appel d'outil non spécifié. Les appels d'outils réels seront définis par défaut. |
REAL |
Utilisez de vrais appels d'outils. |
FAKE |
Utilisez de faux appels d'outils. |
GoldenRunMethod
Méthode utilisée pour exécuter l'évaluation.
| Enums | |
|---|---|
GOLDEN_RUN_METHOD_UNSPECIFIED |
La méthode d'exécution n'est pas spécifiée. |
STABLE |
Exécutez l'évaluation en tant que relecture stable, où chaque tour est une session unique avec les tours attendus précédents injectés en tant que contexte. |
NAIVE |
Exécutez l'évaluation en tant que relecture naïve, où l'exécution est une session unique sans contexte injecté. |
OutcomeMetadata
Métadonnées sur le résultat de l'évaluation.
| Enums | |
|---|---|
OUTCOME_METADATA_UNSPECIFIED |
Métadonnées de résultat non spécifiées. |
GRACEFUL_HANDOFF |
L'évaluation a permis de transférer la demande à un représentant humain. |
Annotations d'outils
Les annotations d'outil sont envoyées aux clients MCP pour décrire le risque de base d'un outil donné. La plupart des clients traitent ces indices comme non fiables, mais ils peuvent être utilisés pour déterminer quand un message de confirmation peut être envoyé à un utilisateur.
En plus de la chaîne de titre, les indications booléennes suivantes sont définies comme suit :
readOnlyHint: si la valeur est "true", l'outil ne modifie pas son environnement. Valeur par défaut : "false".destructiveHint: si la valeur est "true", l'outil peut effectuer des actions destructrices. Si la valeur est "false", l'outil ne peut effectuer que des actions d'ajout. Valeur par défaut : "true".idempotentHint: si la valeur est "true", appeler l'outil à plusieurs reprises avec les mêmes arguments n'aura aucun effet supplémentaire sur son environnement. Valeur par défaut : "false".openWorldHint: si la valeur est "true", l'outil peut interagir avec un "monde ouvert" d'entités externes. Si la valeur est "false", l'outil ne peut interagir qu'avec des entités internes. Par exemple, un outil de recherche Web serait en monde ouvert, tandis qu'un outil de mémoire ne le serait pas.
Indication destructive : ❌ | Indication d'idempotence : ❌ | Indication de lecture seule : ❌ | Indication de monde ouvert : ❌