כלי: create_evaluation
יצירת הערכה חדשה.
בדוגמת הקוד הבאה מוצג שימוש בפקודה curl כדי להפעיל את הכלי create_evaluation MCP.
| בקשת Curl |
|---|
curl --location 'https://ces.googleapis.com/mcp' \ --header 'content-type: application/json' \ --header 'accept: application/json, text/event-stream' \ --data '{ "method": "tools/call", "params": { "name": "create_evaluation", "arguments": { // provide these details according to the tool's MCP specification } }, "jsonrpc": "2.0", "id": 1 }' |
סכימת הקלט
בקשת הודעה עבור EvaluationService.CreateEvaluation.
CreateEvaluationRequest
| ייצוג JSON |
|---|
{
"parent": string,
"evaluationId": string,
"evaluation": {
object ( |
| שדות | |
|---|---|
parent |
חובה. האפליקציה שעבורה רוצים ליצור את ההערכה. פורמט: |
evaluationId |
זה שינוי אופציונלי. המזהה שישמש להערכה, שיהפוך לרכיב הסופי של שם המשאב של ההערכה. אם לא מציינים מזהה, המערכת מקצה מזהה ייחודי באופן אוטומטי לצורך ההערכה. |
evaluation |
חובה. ההערכה שרוצים ליצור. |
הערכה
| ייצוג JSON |
|---|
{ "name": string, "displayName": string, "description": string, "tags": [ string ], "evaluationDatasets": [ string ], "createTime": string, "createdBy": string, "updateTime": string, "lastUpdatedBy": string, "evaluationRuns": [ string ], "etag": string, "aggregatedMetrics": { object ( |
| שדות | |
|---|---|
name |
מזהה. המזהה הייחודי של ההערכה. פורמט: |
displayName |
חובה. שם התצוגה שהמשתמש נתן להערכה. ייחודי באפליקציה. |
description |
זה שינוי אופציונלי. תיאור שהמשתמש מגדיר לגבי ההערכה. |
tags[] |
זה שינוי אופציונלי. תגים שהוגדרו על ידי המשתמש לסיווג הבדיקה. |
evaluationDatasets[] |
פלט בלבד. רשימה של מערכי נתונים להערכה שההערכה שייכת להם. פורמט: |
createTime |
פלט בלבד. חותמת הזמן שבה נוצרה ההערכה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
createdBy |
פלט בלבד. המשתמש שיצר את ההערכה. |
updateTime |
פלט בלבד. חותמת זמן של מועד העדכון האחרון של ההערכה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
lastUpdatedBy |
פלט בלבד. המשתמש שעדכן לאחרונה את ההערכה. |
evaluationRuns[] |
פלט בלבד. ה-EvaluationRuns שההערכה הזו משויכת אליהם. |
etag |
פלט בלבד. תג Etag שמשמש כדי לוודא שהאובייקט לא השתנה במהלך פעולת קריאה-שינוי-כתיבה. אם ה-etag ריק, העדכון ידרוס את כל השינויים שמתבצעים בו-זמנית. |
aggregatedMetrics |
פלט בלבד. המדדים המצטברים של ההערכה הזו בכל ההרצות. |
lastCompletedResult |
פלט בלבד. תוצאת ההערכה האחרונה של ההערכה הזו. |
invalid |
פלט בלבד. האם ההערכה לא תקינה. מצב כזה יכול לקרות אם ההערכה מתייחסת לכלי, לערכת כלים או לנציג שנמחקו מאז. |
lastTenResults[] |
פלט בלבד. 10 התוצאות האחרונות של ההערכה הזו. השדה הזה מאוכלס רק אם הערך של include_last_ten_results מוגדר כ-True ב-ListEvaluationsRequest או ב-GetEvaluationRequest. |
evaluationMetricsThresholdOverride |
זה שינוי אופציונלי. ביטול של ספי מדדים להערכה הספציפית הזו. |
evaluationMetricsConfigOverride |
זה שינוי אופציונלי. הגדרה שמשנה את הגדרות המדדים להערכה הספציפית הזו. |
שדה איחוד inputs. הערך של inputs יכול להיות רק אחד מהבאים: |
|
golden |
זה שינוי אופציונלי. השלבים החשובים שצריך לבדוק. |
scenario |
זה שינוי אופציונלי. ההגדרה של תרחיש. |
זהוב
| ייצוג JSON |
|---|
{
"turns": [
{
object ( |
| שדות | |
|---|---|
turns[] |
חובה. מספר התורות הנדרש כדי להפעיל מחדש שיחה מוזהבת. המספר המקסימלי של תורות שמותר הוא 100. |
evaluationExpectations[] |
זה שינוי אופציונלי. הציפיות להערכה שעל פיהן תתבצע הערכה של השיחה שהופעלה מחדש. פורמט: |
GoldenTurn
| ייצוג JSON |
|---|
{ "steps": [ { object ( |
| שדות | |
|---|---|
steps[] |
חובה. השלבים שנדרשים כדי להפעיל מחדש שיחה לדוגמה. |
rootSpan |
זה שינוי אופציונלי. יחידה לוגית למעקב הבסיסית של התור הזהב לעיבוד ולשמירה של מידע אודיו. ה-URI של האודיו חייב להכיל אודיו שנשמר בתדירות דגימה של 16KHz. |
turnLevelMetricsThresholdsOverride |
זה שינוי אופציונלי. הגדרות שמשנות את ערכי הסף של המדדים ברמת התור. |
hallucinationMetricBehaviorOverride |
זה שינוי אופציונלי. שינוי ברירת המחדל של התנהגות מדד ההזיות ברמת התור. |
שלב
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד step. השלב לביצוע. הערך step יכול להיות רק אחד מהבאים: |
|
userInput |
זה שינוי אופציונלי. קלט של משתמשים לשיחה. |
agentTransfer |
זה שינוי אופציונלי. העברת השיחה לסוכן אחר. |
expectation |
זה שינוי אופציונלי. מריץ ציפייה בתור הנוכחי. |
SessionInput
| ייצוג JSON |
|---|
{ "willContinue": boolean, // Union field |
| שדות | |
|---|---|
willContinue |
זה שינוי אופציונלי. סימון שמציין אם ההודעה הנוכחית היא קטע מקלט גדול יותר בסשן סטרימינג דו-כיווני. אם הערך הוא הערה: השדה הזה לא רלוונטי לקלט של אודיו ו-DTMF, כי הם תמיד מעובדים באופן אוטומטי על סמך אות סיום השיחה. |
שדה איחוד input_type. סוג הקלט. הערך input_type יכול להיות רק אחד מהבאים: |
|
text |
זה שינוי אופציונלי. נתוני טקסט ממשתמש הקצה. |
dtmf |
זה שינוי אופציונלי. ספרות DTMF ממשתמש הקצה. |
audio |
זה שינוי אופציונלי. נתוני אודיו ממשתמש הקצה. מחרוזת בקידוד Base64. |
toolResponses |
זה שינוי אופציונלי. תוצאות ההרצה של קריאות הכלים מהלקוח. |
image |
זה שינוי אופציונלי. נתוני תמונות ממשתמש הקצה. |
blob |
זה שינוי אופציונלי. נתוני Blob ממשתמש הקצה. |
variables |
זה שינוי אופציונלי. משתנים לפי הקשר של הסשן, עם מפתח לפי שם. הנציג של CES ישתמש רק במשתנים שהוגדרו באפליקציה. משתנים לא מזוהים עדיין יישלחו אל [הנציג של Dialogflow][Agent.RemoteDialogflowAgent] כפרמטרים נוספים של הסשן. |
event |
זה שינוי אופציונלי. קלט האירוע. |
ToolResponses
| ייצוג JSON |
|---|
{
"toolResponses": [
{
object ( |
| שדות | |
|---|---|
toolResponses[] |
זה שינוי אופציונלי. רשימת תוצאות ההרצה של הכלי. |
ToolResponse
| ייצוג JSON |
|---|
{ "id": string, "displayName": string, "response": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| שדות | |
|---|---|
id |
זה שינוי אופציונלי. מזהה התשובה התואם של |
displayName |
פלט בלבד. השם המוצג של הכלי. |
response |
חובה. תוצאת ההפעלה של הכלי בפורמט אובייקט JSON. משתמשים במפתח 'output' כדי לציין את התגובה של הכלי ובמפתח 'error' כדי לציין את פרטי השגיאה (אם יש). אם לא מציינים את המפתחות 'פלט' ו'שגיאה', המערכת מתייחסת לכל התגובה כתוצאה של הפעלת הכלי. |
parentToolCallId |
פלט בלבד. המזהה של קריאת הכלי שגרמה לקריאה הזו, כשהיא הונפקה על ידי סוכן משנה שפועל בשם קריאת הורה. השדה ריק עבור שיחות ברמה העליונה. מאפשר ללקוח לקבץ את העבודה של סוכן משנה תחת השיחה שהתחילה אותה, במקום להציג כל שלב כפריט באותה רמה. |
agentName |
פלט בלבד. השם של הסוכן שהנפיק את השיחה הזו, בפורמט שקריא לבני אדם, למשל Contract Architect. השדה ריק אם הסוכן הבסיסי הנפיק את ה-ID. |
שדה איחוד tool_identifier. המזהה של הכלי שהופעל. יכול להיות שמדובר בכלי קבוע או בכלי מתוך ערכת כלים. הערך tool_identifier יכול להיות רק אחד מהבאים: |
|
tool |
זה שינוי אופציונלי. שם הכלי להפעלה. פורמט: |
toolsetTool |
זה שינוי אופציונלי. הכלי בערכת הכלים שהופעל. |
ToolsetTool
| ייצוג JSON |
|---|
{ "toolset": string, "toolId": string } |
| שדות | |
|---|---|
toolset |
חובה. שם המשאב של ערכת הכלים שממנה נגזר הכלי הזה. פורמט: |
toolId |
זה שינוי אופציונלי. מזהה הכלי לסינון הכלים כדי לאחזר את הסכימה שלהם. |
Struct
| ייצוג JSON |
|---|
{ "fields": { string: value, ... } } |
| שדות | |
|---|---|
fields |
מפה לא מסודרת של ערכים עם הקלדה דינמית. אובייקט שמכיל רשימה של |
FieldsEntry
| ייצוג JSON |
|---|
{ "key": string, "value": value } |
| שדות | |
|---|---|
key |
|
value |
|
ערך
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד kind. סוג הערך. הערך kind יכול להיות רק אחד מהבאים: |
|
nullValue |
מייצג JSON |
numberValue |
מייצג מספר JSON. הערך לא יכול להיות |
stringValue |
מייצג מחרוזת JSON. |
boolValue |
מייצג ערך בוליאני ב-JSON (הליטרלים |
structValue |
מייצג אובייקט JSON. |
listValue |
מייצג מערך JSON. |
ListValue
| ייצוג JSON |
|---|
{ "values": [ value ] } |
| שדות | |
|---|---|
values[] |
שדה חוזר של ערכים עם הקלדה דינמית. |
תמונה
| ייצוג JSON |
|---|
{ "mimeType": string, "data": string } |
| שדות | |
|---|---|
mimeType |
חובה. סוג ה-MIME התקני של IANA של נתוני המקור. סוגי התמונות הנתמכים כוללים: * image/png * image/jpeg * image/webp |
data |
חובה. בייטים גולמיים של התמונה. מחרוזת בקידוד Base64. |
Blob
| ייצוג JSON |
|---|
{ "mimeType": string, "data": string } |
| שדות | |
|---|---|
mimeType |
חובה. סוג ה-MIME התקני של IANA של נתוני המקור. |
data |
חובה. בייטים גולמיים של ה-blob. מחרוזת בקידוד Base64. |
אירוע
| ייצוג JSON |
|---|
{ "event": string } |
| שדות | |
|---|---|
event |
חובה. שם האירוע. |
AgentTransfer
| ייצוג JSON |
|---|
{ "targetAgent": string, "displayName": string } |
| שדות | |
|---|---|
targetAgent |
חובה. הסוכן שאליו מועברת השיחה. הנציג יטפל בשיחה מעכשיו והלאה. פורמט: |
displayName |
פלט בלבד. השם המוצג של הסוכן. |
GoldenExpectation
| ייצוג JSON |
|---|
{ "note": string, "skipEvaluation": boolean, "expectationLevelMetricsThresholdsOverride": { object ( |
| שדות | |
|---|---|
note |
זה שינוי אופציונלי. הערה לגבי הדרישה הזו, שיכולה לעזור לכם לדווח על מקרים שבהם בדיקות ספציפיות נכשלות. למשל, "Check_Payment_Tool_Called". |
skipEvaluation |
זה שינוי אופציונלי. אם הערך מוגדר כ-true, הציפייה הספציפית הזו לא תיבדק. |
expectationLevelMetricsThresholdsOverride |
זה שינוי אופציונלי. מבטל את המדדים ברמת השלב. |
agentResponseSemanticSimilarityMetricsConfigOverride |
זה שינוי אופציונלי. הגדרות ברירת מחדל לשינוי מדדי הדמיון הסמנטי של agent_response. |
agentResponseHallucinationMetricsConfigOverride |
זה שינוי אופציונלי. שינויים במדדים של הזיות בתשובות של סוכנים. |
comparisonType |
זה שינוי אופציונלי. סוג ההשוואה שמשמש לבדיקת הציפייה. |
שדה איחוד condition. הבדיקה בפועל שצריך לבצע. הערך condition יכול להיות רק אחד מהבאים: |
|
toolCall |
זה שינוי אופציונלי. בודקים אם בוצעה קריאה לכלי ספציפי עם הפרמטרים. |
toolResponse |
זה שינוי אופציונלי. בודקים אם כלי ספציפי הגיב בצורה הצפויה. |
agentResponse |
זה שינוי אופציונלי. בודקים שהנציג הווירטואלי הגיב בתשובה הנכונה. התפקיד 'סוכן' מרומז. |
agentTransfer |
זה שינוי אופציונלי. בודקים שהנציג העביר את השיחה לנציג אחר. |
updatedVariables |
זה שינוי אופציונלי. בודקים שהסוכן עדכן את משתני הסשן לערכים הצפויים. הוא שימש גם לתיעוד של עדכוני משתנים של סוכנים לצורך הערכות מוזהבות. |
mockToolResponse |
זה שינוי אופציונלי. התגובה של הכלי ל-mock, עם הפרמטרים שמעניינים אתכם. כל הפרמטרים שלא צוינו יומצאו על ידי ה-LLM. |
noToolCalls |
זה שינוי אופציונלי. בודקים שלא נעשה שימוש בכלים במהלך התור הזה. |
ToolCall
| ייצוג JSON |
|---|
{ "id": string, "displayName": string, "args": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| שדות | |
|---|---|
id |
זה שינוי אופציונלי. המזהה הייחודי של קריאת הכלי. אם השדה מאוכלס, הלקוח צריך להחזיר את תוצאת ההפעלה עם המזהה התואם בשדה |
displayName |
פלט בלבד. השם המוצג של הכלי. |
args |
זה שינוי אופציונלי. פרמטרי הקלט והערכים של הכלי בפורמט אובייקט JSON. |
parentToolCallId |
פלט בלבד. המזהה של קריאת הכלי שגרמה לקריאה הזו, כשהיא הונפקה על ידי סוכן משנה שפועל בשם קריאת הורה. השדה ריק עבור שיחות ברמה העליונה. מאפשר ללקוח לקבץ את העבודה של סוכן משנה תחת השיחה שהתחילה אותה, במקום להציג כל שלב כפריט באותה רמה. |
agentName |
פלט בלבד. השם של הסוכן שהנפיק את השיחה הזו, בפורמט שקריא לבני אדם, למשל Contract Architect. השדה ריק אם הסוכן הבסיסי הנפיק את ה-ID. |
שדה איחוד tool_identifier. המזהה של הכלי להפעלה. יכול להיות שמדובר בכלי קבוע או בכלי מתוך ערכת כלים. הערך tool_identifier יכול להיות רק אחד מהבאים: |
|
tool |
זה שינוי אופציונלי. שם הכלי להפעלה. פורמט: |
toolsetTool |
זה שינוי אופציונלי. הכלי להרצה בערכת הכלים. |
הודעה
| ייצוג JSON |
|---|
{
"role": string,
"chunks": [
{
object ( |
| שדות | |
|---|---|
role |
זה שינוי אופציונלי. התפקיד בשיחה, למשל: משתמש, נציג. |
chunks[] |
זה שינוי אופציונלי. תוכן ההודעה כסדרה של נתחים. |
eventTime |
זה שינוי אופציונלי. חותמת הזמן שבה ההודעה נשלחה או התקבלה. אסור להשתמש בערך הזה אם ההודעה היא חלק מ הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
חלק
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד data. לחלק את הנתונים לחלקים. הערך data יכול להיות רק אחד מהבאים: |
|
text |
זה שינוי אופציונלי. נתוני טקסט. |
transcript |
זה שינוי אופציונלי. תמליל שמשויך לאודיו. |
blob |
זה שינוי אופציונלי. נתוני Blob. |
payload |
זה שינוי אופציונלי. נתונים של מטען ייעודי בהתאמה אישית. |
image |
זה שינוי אופציונלי. נתוני תמונה. |
toolCall |
זה שינוי אופציונלי. בקשה להרצת כלי. |
toolResponse |
זה שינוי אופציונלי. תשובה להרצת הכלי. |
agentTransfer |
זה שינוי אופציונלי. אירוע העברה של סוכן. |
updatedVariables |
מבנה נתונים מייצג משתנים שעודכנו בשיחה, עם מפתחות לפי שמות המשתנים. |
defaultVariables |
מבנה נתונים מייצג משתני ברירת מחדל בתחילת השיחה, עם מפתחות לפי שמות המשתנים. |
חותמת הזמן
| ייצוג JSON |
|---|
{ "seconds": string, "nanos": integer } |
| שדות | |
|---|---|
seconds |
מייצג את השניות של זמן UTC מאז ראשית זמן יוניקס (Unix epoch) 1970-01-01T00:00:00Z. הערך חייב להיות בין -62135596800 ל-253402300799, כולל (שמתאים לטווח 0001-01-01T00:00:00Z עד 9999-12-31T23:59:59Z). |
nanos |
שבריר לא שלילי של שנייה ברזולוציית ננו-שנייה. השדה הזה מייצג את החלק של משך הזמן בננו-שניות, ולא מהווה חלופה לשניות. ערכי שניות שליליים עם שברים עדיין צריכים לכלול ערכי ננו-שניות לא שליליים שסופרים קדימה בזמן. הערך חייב להיות בין 0 ל-999,999,999, כולל. |
ExpectationLevelMetricsThresholds
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד הערך |
|
toolInvocationParameterCorrectnessThreshold |
זה שינוי אופציונלי. סף ההצלחה לפרמטרים נפרדים של הפעלת כלי. חייב להיות מספר עשרוני בין 0 ל-1. ברירת המחדל היא 1.0. |
SemanticSimilarityMetricsConfig
| ייצוג JSON |
|---|
{ "enableSemanticSimilarityMetrics": boolean } |
| שדות | |
|---|---|
enableSemanticSimilarityMetrics |
זה שינוי אופציונלי. האם לחשב מדדים של דמיון סמנטי לצורך ההערכה. |
HallucinationMetricsConfig
| ייצוג JSON |
|---|
{ "enableHallucinationMetrics": boolean } |
| שדות | |
|---|---|
enableHallucinationMetrics |
זה שינוי אופציונלי. האם לחשב מדדי הזיות לצורך ההערכה. |
Span
| ייצוג JSON |
|---|
{
"name": string,
"startTime": string,
"endTime": string,
"duration": string,
"attributes": {
object
},
"childSpans": [
{
object ( |
| שדות | |
|---|---|
name |
פלט בלבד. השם של ה-span. |
startTime |
פלט בלבד. שעת ההתחלה של טווח הזמן. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
endTime |
פלט בלבד. שעת הסיום של טווח הזמן. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
duration |
פלט בלבד. משך הזמן של הטווח. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
attributes |
פלט בלבד. מאפייני מפתח/ערך שמשויכים לטווח. |
childSpans[] |
פלט בלבד. טווחים משניים שמוטמעים בטווח הזה. |
משך
| ייצוג JSON |
|---|
{ "seconds": string, "nanos": integer } |
| שדות | |
|---|---|
seconds |
מספר השניות עם סימן של טווח הזמן. הערך חייב להיות בין -315,576,000,000 לבין +315,576,000,000, כולל. הערה: הגבולות האלה מחושבים לפי: 60 שניות בדקה * 60 דקות בשעה * 24 שעות ביממה * 365.25 ימים בשנה * 10,000 שנים |
nanos |
שברים חתומים של שנייה ברזולוציית ננו-שנייה של טווח הזמן. משכי זמן של פחות משנייה אחת מיוצגים באמצעות שדה |
TurnLevelMetricsThresholds
| ייצוג JSON |
|---|
{ "semanticSimilarityChannel": enum ( |
| שדות | |
|---|---|
semanticSimilarityChannel |
זה שינוי אופציונלי. הערוץ של הדמיון הסמנטי שבו רוצים להשתמש להערכה. |
שדה איחוד הערך |
|
semanticSimilaritySuccessThreshold |
זה שינוי אופציונלי. סף ההצלחה לדמיון סמנטי. חייב להיות מספר שלם בין 0 ל-4. ברירת המחדל היא >= 3. |
שדה איחוד הערך |
|
overallToolInvocationCorrectnessThreshold |
זה שינוי אופציונלי. סף ההצלחה לדיוק הכולל של הפעלת הכלי. חייב להיות מספר עשרוני בין 0 ל-1. ברירת המחדל היא 1.0. |
תרחיש
| ייצוג JSON |
|---|
{ "task": string, "userFacts": [ { object ( |
| שדות | |
|---|---|
task |
חובה. המשימה שהתרחיש יתמקד בה. |
userFacts[] |
זה שינוי אופציונלי. העובדות על המשתמש שבהן התרחיש ישתמש. |
maxTurns |
זה שינוי אופציונלי. מספר הפניות המקסימלי לסימולציה. הערך המקסימלי המותר הוא 100. ערך ברירת המחדל הוא 100. |
rubrics[] |
חובה. קריטריונים לדירוג התרחיש. |
scenarioExpectations[] |
חובה. ה-ScenarioExpectations להערכת השיחה שנוצרה על ידי סימולציית המשתמש. |
variableOverrides |
זה שינוי אופציונלי. משתנים / פרמטרים של סשן כהקשר לסשן, עם מפתח לפי שמות המשתנים. הערכים של המשתנים האלה יחליפו את ערכי ברירת המחדל שהוגדרו על ידי המערכת. הערה: אלה עובדות שונות מעובדות על המשתמש, שהן עובדות שהמשתמש מכיר. משתנים הם פרמטרים שהסוכן מכיר: כלומר, MDN (מספר טלפון) שמועבר על ידי מערכת הטלפוניה. |
taskCompletionBehavior |
זה שינוי אופציונלי. הוצאה משימוש, במקום זאת, צריך להשתמש במאפיין user_goal_behavior. |
userGoalBehavior |
זה שינוי אופציונלי. ההתנהגות הצפויה של המשתמש ביחס ליעד. |
evaluationExpectations[] |
זה שינוי אופציונלי. הציפיות להערכה שמשמשות להערכת השיחה שנוצרה על ידי הסימולציה. פורמט: |
scenarioExecutionMode |
זה שינוי אופציונלי. מצב ההרצה של הערכות התרחישים. |
UserFact
| ייצוג JSON |
|---|
{ "name": string, "value": string } |
| שדות | |
|---|---|
name |
חובה. השם של עובדת המשתמש. |
value |
חובה. הערך של נתון המשתמש. |
ScenarioExpectation
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד expectation. הציפייה להערכת השיחה שנוצרה על ידי הסימולציה. הערך expectation יכול להיות רק אחד מהבאים: |
|
toolExpectation |
זה שינוי אופציונלי. הזוג של קריאה לכלי ותגובה שצריך להעריך. |
agentResponse |
זה שינוי אופציונלי. תשובת הסוכן שצריך להעריך. |
ToolExpectation
| ייצוג JSON |
|---|
{ "expectedToolCall": { object ( |
| שדות | |
|---|---|
expectedToolCall |
חובה. הקריאה הצפויה לכלי, עם הפרמטרים הרלוונטיים שצוינו. כל הפרמטרים שלא צוינו יומצאו על ידי ה-LLM. |
mockToolResponse |
חובה. התגובה של הכלי ל-mock, עם הפרמטרים שמעניינים אתכם. כל הפרמטרים שלא צוינו יומצאו על ידי ה-LLM. |
AggregatedMetrics
| ייצוג JSON |
|---|
{
"metricsByAppVersion": [
{
object ( |
| שדות | |
|---|---|
metricsByAppVersion[] |
פלט בלבד. מדדים מצטברים, מקובצים לפי מזהה גרסת האפליקציה. |
MetricsByAppVersion
| ייצוג JSON |
|---|
{ "appVersionId": string, "toolMetrics": [ { object ( |
| שדות | |
|---|---|
appVersionId |
פלט בלבד. מזהה גרסת האפליקציה. |
toolMetrics[] |
פלט בלבד. מדדים לכל כלי בגרסה הזו של האפליקציה. |
semanticSimilarityMetrics[] |
פלט בלבד. מדדים לדמיון סמנטי בגרסת האפליקציה הזו. |
hallucinationMetrics[] |
פלט בלבד. מדדים להזיות בגרסת האפליקציה הזו. |
toolCallLatencyMetrics[] |
פלט בלבד. מדדים של זמן האחזור של קריאות לכלי בגרסה הזו של האפליקציה. |
turnLatencyMetrics[] |
פלט בלבד. מדדים של זמן התגובה בגרסת האפליקציה הזו. |
passCount |
פלט בלבד. מספר הפעמים שההערכה עברה. |
failCount |
פלט בלבד. מספר הפעמים שההערכה נכשלה. |
metricsByTurn[] |
פלט בלבד. מדדים מצטברים לכל תור בגרסת האפליקציה הזו. |
ToolMetrics
| ייצוג JSON |
|---|
{ "tool": string, "passCount": integer, "failCount": integer } |
| שדות | |
|---|---|
tool |
פלט בלבד. שם הכלי. |
passCount |
פלט בלבד. מספר הפעמים שהכלי עבר. |
failCount |
פלט בלבד. מספר הפעמים שהכלי נכשל. |
SemanticSimilarityMetrics
| ייצוג JSON |
|---|
{ "score": number } |
| שדות | |
|---|---|
score |
פלט בלבד. הציון הממוצע של הדמיון הסמנטי (0-4). |
HallucinationMetrics
| ייצוג JSON |
|---|
{ "score": number } |
| שדות | |
|---|---|
score |
פלט בלבד. הציון הממוצע של הזיות (0 עד 1). |
ToolCallLatencyMetrics
| ייצוג JSON |
|---|
{ "tool": string, "averageLatency": string } |
| שדות | |
|---|---|
tool |
פלט בלבד. שם הכלי. |
averageLatency |
פלט בלבד. החביון הממוצע של קריאות הכלים. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
TurnLatencyMetrics
| ייצוג JSON |
|---|
{ "averageLatency": string } |
| שדות | |
|---|---|
averageLatency |
פלט בלבד. זמן האחזור הממוצע של התורות. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
MetricsByTurn
| ייצוג JSON |
|---|
{ "turnIndex": integer, "toolMetrics": [ { object ( |
| שדות | |
|---|---|
turnIndex |
פלט בלבד. אינדקס הפנייה (מתחיל מ-0). |
toolMetrics[] |
פלט בלבד. מדדים לכל כלי בתור הזה. |
semanticSimilarityMetrics[] |
פלט בלבד. מדדים לדמיון סמנטי בתור הזה. |
hallucinationMetrics[] |
פלט בלבד. מדדים להזיות בתור הזה. |
toolCallLatencyMetrics[] |
פלט בלבד. מדדים של זמן האחזור של קריאה לכלי בתור הזה. |
turnLatencyMetrics[] |
פלט בלבד. מדדים של זמן הטעינה של התור הנוכחי. |
EvaluationResult
| ייצוג JSON |
|---|
{ "name": string, "displayName": string, "createTime": string, "evaluationStatus": enum ( |
| שדות | |
|---|---|
name |
מזהה. המזהה הייחודי של תוצאת הבדיקה. פורמט: |
displayName |
חובה. השם המוצג של תוצאת ההערכה. ייחודי בתוך הערכה. כברירת מחדל, הפורמט הוא: |
createTime |
פלט בלבד. חותמת הזמן שבה נוצרה תוצאת ההערכה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
evaluationStatus |
פלט בלבד. תוצאת ההערכה. השדה הזה מאוכלס רק אם execution_state הוא COMPLETE. |
evaluationRun |
פלט בלבד. הפעלת ההערכה שהניבה את התוצאה הזו. פורמט: |
persona |
פלט בלבד. הפרסונה ששימשה ליצירת השיחה לתוצאת ההערכה. |
errorInfo |
פלט בלבד. פרטי השגיאה בתוצאת ההערכה. |
error |
פלט בלבד. הוצא משימוש: במקומו, צריך להשתמש ב- |
initiatedBy |
פלט בלבד. המשתמש שיזם את הרצת ההערכה שהניבה את התוצאה הזו. |
appVersion |
פלט בלבד. גרסת האפליקציה ששימשה ליצירת השיחה שהובילה לתוצאה הזו. פורמט: |
appVersionDisplayName |
פלט בלבד. השם המוצג של |
changelog |
פלט בלבד. יומן השינויים של גרסת האפליקציה שההערכה בוצעה לגביה. השדה הזה מאוכלס אם המשתמש מריץ הערכה בגרסה האחרונה או בטיוטה. |
changelogCreateTime |
פלט בלבד. זמן היצירה של יומן השינויים של גרסת האפליקציה שההערכה הופעלה לגביה. השדה הזה מאוכלס אם המשתמש מריץ הערכה בגרסה האחרונה או בטיוטה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
executionState |
פלט בלבד. המצב של ביצוע תוצאת ההערכה. |
evaluationMetricsThresholds |
פלט בלבד. ספי הבדיקה של התוצאה. |
config |
פלט בלבד. ההגדרה שבה נעשה שימוש בהרצת ההערכה שהניבה את התוצאה הזו. |
goldenRunMethod |
פלט בלבד. השיטה שבה נעשה שימוש להפעלת הערכת הזהב. |
rootSpan |
פלט בלבד. יחידה לוגית למעקב ברמת הבסיס של הרצת ההערכה, שכוללת מידע על כל שלב בהערכה. |
outcomeMetadata |
פלט בלבד. מטא-נתונים של תוצאת הבדיקה. השדה הזה מאוכלס רק אם execution_state הוא COMPLETE. |
שדה איחוד result. התוצאה של ההערכה. השדה הזה מאוכלס רק כש-execution_state הוא COMPLETED. הערך result יכול להיות רק אחד מהבאים: |
|
goldenResult |
פלט בלבד. התוצאה של הערכת הזהב. |
scenarioResult |
פלט בלבד. התוצאה של הערכת תרחיש. |
GoldenResult
| ייצוג JSON |
|---|
{ "turnReplayResults": [ { object ( |
| שדות | |
|---|---|
turnReplayResults[] |
פלט בלבד. התוצאה של הרצת כל תור בשיחה המוזהבת. |
evaluationExpectationResults[] |
פלט בלבד. תוצאות הציפיות מההערכה. |
TurnReplayResult
| ייצוג JSON |
|---|
{ "conversation": string, "expectationOutcome": [ { object ( |
| שדות | |
|---|---|
conversation |
פלט בלבד. השיחה שנוצרה בתור הזה. |
expectationOutcome[] |
פלט בלבד. התוצאה של כל ציפייה. |
hallucinationResult |
פלט בלבד. התוצאה של בדיקת ההזיות. |
toolInvocationScore |
פלט בלבד. הוצאה משימוש, במקומו, צריך להשתמש ב-OverallToolInvocationResult. |
turnLatency |
פלט בלבד. משך התור. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
toolCallLatencies[] |
פלט בלבד. החביון של כל קריאה לכלי בתור. |
semanticSimilarityResult |
פלט בלבד. התוצאה של בדיקת הדמיון הסמנטי. |
overallToolInvocationResult |
פלט בלבד. התוצאה של הבדיקה הכוללת של הפעלת הכלי. |
errorInfo |
פלט בלבד. מידע על השגיאה שאירעה במהלך התור הזה. |
spanLatencies[] |
פלט בלבד. זמן האחזור של טווחי הזמן בפנייה. |
שדה איחוד הערך |
|
toolOrderedInvocationScore |
פלט בלבד. הציון הכולל של הפעלת הכלי בתור הזה. המדד הזה מציין את אחוז הכלים הכולל מתוך התור הצפוי שהופעלו בפועל בסדר הצפוי. |
GoldenExpectationOutcome
| ייצוג JSON |
|---|
{ "expectation": { object ( |
| שדות | |
|---|---|
expectation |
פלט בלבד. הציפייה שנבדקה. |
outcome |
פלט בלבד. התוצאה של הציפייה. |
semanticSimilarityResult |
פלט בלבד. התוצאה של בדיקת הדמיון הסמנטי. |
toolInvocationResult |
פלט בלבד. התוצאה של בדיקת ההפעלה של הכלי. |
שדה איחוד result. התוצאה של הציפייה. הערך result יכול להיות רק אחד מהבאים: |
|
observedToolCall |
פלט בלבד. התוצאה של הציפייה לקריאה לכלי. |
observedToolResponse |
פלט בלבד. התוצאה של הציפייה לתגובה מהכלי. |
observedAgentResponse |
פלט בלבד. התוצאה של הציפייה לתגובה מהסוכן. |
observedAgentTransfer |
פלט בלבד. התוצאה של ההעברה הצפויה לנציג. |
observedPayload |
פלט בלבד. מטען ייעודי (payload) מותאם אישית שנצפה. אין ציפיות לגבי מטען ייעודי (payload) בהתאמה אישית. הערך הזה משמש רק לחישוב מדדים. התוצאה תמיד תהיה SKIPPED. |
SemanticSimilarityResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, "outcome": enum ( |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 4: עקבי לחלוטין ציון 3: עקבי ברובו ציון 2: עקבי באופן חלקי (השמטות קלות) ציון 1: לא עקבי במידה רבה (השמטות משמעותיות) ציון 0: לא עקבי לחלוטין / סותר |
explanation |
פלט בלבד. ההסבר לציון הדמיון הסמנטי. |
outcome |
פלט בלבד. התוצאה של בדיקת הדמיון הסמנטי. הוא נקבע על ידי השוואת הציון לערך של semantic_similarity_success_threshold. אם הניקוד שווה לסף או גבוה ממנו, התוצאה תהיה PASS. אחרת, התוצאה תהיה FAIL. |
שדה איחוד הערך |
|
score |
פלט בלבד. ציון הדמיון הסמנטי. יכול להיות 0, 1, 2, 3 או 4. |
ToolInvocationResult
| ייצוג JSON |
|---|
{ "outcome": enum ( |
| שדות | |
|---|---|
outcome |
פלט בלבד. התוצאה של בדיקת ההפעלה של הכלי. ההחלטה מתקבלת על סמך השוואה בין הציון parameter_correctness_score לבין ערך הסף. אם הניקוד שווה לסף או גבוה ממנו, התוצאה תהיה PASS. אחרת, התוצאה תהיה FAIL. |
explanation |
פלט בלבד. הסבר בטקסט חופשי לתוצאה של הפעלת הכלי. |
שדה איחוד הערך |
|
parameterCorrectnessScore |
פלט בלבד. ציון הדיוק של פרמטר ההפעלה של הכלי. הערך הזה מציין את אחוז הפרמטרים מתוך קריאת הכלי הצפויה שהיו גם בקריאת הכלי בפועל. |
HallucinationResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 1: מוצדק ציון 0: לא מוצדק ציון -1: אין טענה להערכה |
explanation |
פלט בלבד. ההסבר לציון ההזיה. |
שדה איחוד הערך |
|
score |
פלט בלבד. ציון ההזיות. יכול להיות -1, 0, 1. |
ToolCallLatency
| ייצוג JSON |
|---|
{ "tool": string, "displayName": string, "startTime": string, "endTime": string, "executionLatency": string } |
| שדות | |
|---|---|
tool |
פלט בלבד. שם הכלי שהופעל. פורמט: |
displayName |
פלט בלבד. השם המוצג של הכלי. |
startTime |
פלט בלבד. שעת ההתחלה של הרצת הכלי. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
endTime |
פלט בלבד. שעת הסיום של ההרצה של קריאת הכלי. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
executionLatency |
פלט בלבד. זמן האחזור של הפעלת הכלי. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
OverallToolInvocationResult
| ייצוג JSON |
|---|
{ "outcome": enum ( |
| שדות | |
|---|---|
outcome |
פלט בלבד. התוצאה של בדיקת ההפעלה של הכלי. ההחלטה מתקבלת על ידי השוואה בין הציון tool_invocation_score לבין סף הדיוק הכולל של הפעלת הכלי overall_tool_invocation_correctness_threshold. אם הניקוד שווה לסף או גבוה ממנו, התוצאה תהיה PASS. אחרת, התוצאה תהיה FAIL. |
שדה איחוד הערך |
|
toolInvocationScore |
הציון הכולל של הפעלת הכלי בתור הזה. המדד הזה מציין את האחוז הכולל של הכלים מהתור הצפוי שהופעלו בפועל. |
EvaluationErrorInfo
| ייצוג JSON |
|---|
{
"errorType": enum ( |
| שדות | |
|---|---|
errorType |
פלט בלבד. סוג השגיאה. |
errorMessage |
פלט בלבד. הודעת השגיאה. |
sessionId |
פלט בלבד. מזהה הסשן של השיחה שגרמה לשגיאה. |
userFacingErrorMessage |
פלט בלבד. הודעת השגיאה שמוצגת למשתמש. |
SpanLatency
| ייצוג JSON |
|---|
{ "type": enum ( |
| שדות | |
|---|---|
type |
פלט בלבד. סוג הטווח. |
displayName |
פלט בלבד. השם המוצג של הטווח. רלוונטי לכלים ולגבולות שמוגדרים בטווחים. |
startTime |
פלט בלבד. שעת ההתחלה של הטווח. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
endTime |
פלט בלבד. שעת הסיום של טווח הזמן. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
executionLatency |
פלט בלבד. זמן האחזור של הטווח. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
שדה איחוד identifier. המזהה של הפריט הספציפי על סמך הסוג שלו. הערך identifier יכול להיות רק אחד מהבאים: |
|
resource |
פלט בלבד. שם המשאב של אמצעי הבקרה או של הכלים. |
toolset |
פלט בלבד. מזהה הכלי בערכת הכלים. |
model |
פלט בלבד. השם של טווח ה-LLM. |
callback |
פלט בלבד. השם של טווח הקריאה החוזרת של המשתמש. |
EvaluationExpectationResult
| ייצוג JSON |
|---|
{
"evaluationExpectation": string,
"prompt": string,
"outcome": enum ( |
| שדות | |
|---|---|
evaluationExpectation |
פלט בלבד. הציפייה מההערכה. פורמט: |
prompt |
פלט בלבד. ההנחיה שבה נעשה שימוש לצורך ההערכה. |
outcome |
פלט בלבד. התוצאה של ציפיית ההערכה. |
explanation |
פלט בלבד. ההסבר לתוצאה. |
ScenarioResult
| ייצוג JSON |
|---|
{ "conversation": string, "task": string, "userFacts": [ { object ( |
| שדות | |
|---|---|
conversation |
פלט בלבד. השיחה שנוצרה בתרחיש. |
task |
פלט בלבד. המשימה ששימשה להרצת התרחיש לתוצאה הזו. |
userFacts[] |
פלט בלבד. הנתונים על המשתמש ששימשו את התרחיש לחישוב התוצאה הזו. |
expectationOutcomes[] |
פלט בלבד. התוצאה של כל ציפייה. |
rubricOutcomes[] |
פלט בלבד. התוצאה של קריטריון ההערכה. |
hallucinationResult[] |
פלט בלבד. התוצאה של בדיקת ההזיות. תהיה תוצאת הזיה אחת לכל תור בשיחה. |
taskCompletionResult |
פלט בלבד. התוצאה של בדיקת השלמת המשימה. |
toolCallLatencies[] |
פלט בלבד. ההשהיה של כל הפעלה של קריאה לכלי בשיחה. |
userGoalSatisfactionResult |
פלט בלבד. התוצאה של בדיקת שביעות הרצון של המשתמש מהשגת המטרה. |
spanLatencies[] |
פלט בלבד. ההשהיה של טווחי הזמן בשיחה. |
evaluationExpectationResults[] |
פלט בלבד. תוצאות הציפיות מההערכה. |
שדה איחוד הערך |
|
allExpectationsSatisfied |
פלט בלבד. האם כל הציפיות התממשו בתור הזה. |
שדה איחוד הערך |
|
taskCompleted |
פלט בלבד. האם המשימה הושלמה בתור הזה. התשובה מורכבת מכל הציפיות שהתממשו, ללא הזיות, וממידת שביעות הרצון של המשתמש מהשגת היעד. |
ScenarioExpectationOutcome
| ייצוג JSON |
|---|
{ "expectation": { object ( |
| שדות | |
|---|---|
expectation |
פלט בלבד. הציפייה שנבדקה. |
outcome |
פלט בלבד. התוצאה של ScenarioExpectation. |
שדה איחוד result. התוצאה של הציפייה. הערך result יכול להיות רק אחד מהבאים: |
|
observedToolCall |
פלט בלבד. הקריאה לכלי שנצפתה. |
observedAgentResponse |
פלט בלבד. התשובה שנצפתה מהסוכן. |
ObservedToolCall
| ייצוג JSON |
|---|
{ "toolCall": { object ( |
| שדות | |
|---|---|
toolCall |
פלט בלבד. הקריאה לכלי שנצפתה. |
toolResponse |
פלט בלבד. התשובה שנצפתה מהכלי. |
ScenarioRubricOutcome
| ייצוג JSON |
|---|
{ "rubric": string, "scoreExplanation": string, // Union field |
| שדות | |
|---|---|
rubric |
פלט בלבד. קריטריון ההערכה ששימש להערכת השיחה. |
scoreExplanation |
פלט בלבד. התשובה של המעריך לקריטריון ההערכה. |
שדה איחוד הערך |
|
score |
פלט בלבד. הציון של השיחה בהשוואה לקריטריון ההערכה. |
TaskCompletionResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 1: ציון על השלמת משימה ציון 0: ציון על אי-השלמת משימה ציון -1: יעד המשתמש לא הוגדר |
explanation |
פלט בלבד. הסבר על ציון השלמת המשימה. |
שדה איחוד הערך |
|
score |
פלט בלבד. הציון על השלמת המשימה. יכול להיות -1, 0, 1 |
UserGoalSatisfactionResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 2: ציון העברה חלקה ציון 1: ציון שביעות רצון של המשתמש מהמשימה ציון 0: ציון חוסר שביעות רצון של המשתמש מהמשימה ציון -1: ציון לא מוגדר של שביעות רצון של המשתמש מהמשימה |
explanation |
פלט בלבד. הסבר לציון שביעות הרצון של המשתמש מהמשימה. |
שדה איחוד הערך |
|
score |
פלט בלבד. ציון שביעות הרצון של המשתמש מהמשימה. יכול להיות -1, 0, 1, 2. |
EvaluationPersona
| ייצוג JSON |
|---|
{
"name": string,
"description": string,
"displayName": string,
"personality": string,
"speechConfig": {
object ( |
| שדות | |
|---|---|
name |
חובה. המזהה הייחודי של האישיות. פורמט: |
description |
זה שינוי אופציונלי. תיאור של האישיות. |
displayName |
חובה. השם המוצג של האישיות. ייחודי בתוך אפליקציה. |
personality |
חובה. הוראה לסוכן לגבי אופן ההתנהגות בתהליך ההערכה. |
speechConfig |
זה שינוי אופציונלי. הגדרות של איך האישיות נשמעת (הגדרות TTS). |
SpeechConfig
| ייצוג JSON |
|---|
{
"speakingRate": number,
"environment": enum ( |
| שדות | |
|---|---|
speakingRate |
זה שינוי אופציונלי. קצב הדיבור. 1.0 הוא ערך רגיל. ערך נמוך יותר מייצג קצב איטי יותר (למשל, 0.8), וערך גבוה יותר מייצג קצב מהיר יותר (למשל, 1.5). הבדיקה הזו שימושית כדי לראות איך הסוכן מתמודד עם אנשים שמדברים מהר. |
environment |
זה שינוי אופציונלי. סביבת האודיו המדומה. |
voiceId |
זה שינוי אופציונלי. המזהה הספציפי של הקול או המבטא שבו רוצים להשתמש. דוגמה: en-US-Wavenet-D או en-GB-Standard-A |
סטטוס
| ייצוג JSON |
|---|
{ "code": integer, "message": string, "details": [ { "@type": string, field1: ..., ... } ] } |
| שדות | |
|---|---|
code |
קוד הסטטוס, שצריך להיות ערך enum של |
message |
הודעת שגיאה שמוצגת למפתחים, שצריכה להיות באנגלית. כל הודעת שגיאה שמוצגת למשתמש צריכה להיות מותאמת לשפה המקומית ולהישלח בשדה |
details[] |
רשימה של הודעות שכוללות את פרטי השגיאה. יש קבוצה משותפת של סוגי הודעות לשימוש בממשקי API. אובייקט שמכיל שדות מסוג שרירותי. שדה נוסף |
הכול
| ייצוג JSON |
|---|
{ "typeUrl": string, "value": string } |
| שדות | |
|---|---|
typeUrl |
מזהה את הסוג של הודעת Protobuf שעברה סריאליזציה באמצעות הפניה ל-URI שכוללת קידומת שמסתיימת בקו נטוי ואת שם הסוג שמוגדר במלואו. דוגמה: type.googleapis.com/google.protobuf.StringValue המחרוזת הזו צריכה להכיל לפחות תו אחד של הקידומת היא שרירותית, וההטמעות של Protobuf אמורות פשוט להסיר את כל מה שמופיע עד הסימן כל מחרוזות כתובות ה-URL של הסוג חייבות להיות הפניות חוקיות ל-URI, עם הגבלה נוספת (בפורמט הטקסט) שלפיה התוכן של ההפניה חייב לכלול רק תווים אלפאנומריים, תווים מיוחדים עם קידוד אחוזים ותווים מהקבוצה הבאה (לא כולל הגרשיים החיצוניים): בתכנון המקורי של |
value |
מכיל סריאליזציה של Protobuf של הסוג שמתואר על ידי type_url. מחרוזת בקידוד Base64. |
EvaluationMetricsThresholds
| ייצוג JSON |
|---|
{ "goldenEvaluationMetricsThresholds": { object ( |
| שדות | |
|---|---|
goldenEvaluationMetricsThresholds |
זה שינוי אופציונלי. ערכי הסף של מדדי ההערכה המושלמים. |
hallucinationMetricBehavior |
זה שינוי אופציונלי. הוצא משימוש: במקומו, צריך להשתמש ב- |
goldenHallucinationMetricBehavior |
זה שינוי אופציונלי. התנהגות מדד ההזיות בהערכות מוזהבות. |
scenarioHallucinationMetricBehavior |
זה שינוי אופציונלי. התנהגות מדד ההזיות בהערכות של תרחישים. |
GoldenEvaluationMetricsThresholds
| ייצוג JSON |
|---|
{ "turnLevelMetricsThresholds": { object ( |
| שדות | |
|---|---|
turnLevelMetricsThresholds |
זה שינוי אופציונלי. ערכי הסף של המדדים ברמת התור. |
expectationLevelMetricsThresholds |
זה שינוי אופציונלי. ערכי הסף של מדדי רמת הציפייה. |
toolMatchingSettings |
זה שינוי אופציונלי. הגדרות ההתאמה של הכלי. קריאה נוספת לכלי היא קריאה לכלי שקיימת בהרצה אבל לא תואמת לאף קריאה לכלי בציפייה המוזהבת. |
ToolMatchingSettings
| ייצוג JSON |
|---|
{
"extraToolCallBehavior": enum ( |
| שדות | |
|---|---|
extraToolCallBehavior |
זה שינוי אופציונלי. התנהגות במקרה של קריאות נוספות לכלים. ברירת המחדל היא FAIL. |
EvaluationConfig
| ייצוג JSON |
|---|
{ "inputAudioConfig": { object ( |
| שדות | |
|---|---|
inputAudioConfig |
זה שינוי אופציונלי. הגדרות לעיבוד האודיו שמתקבל מהמיקרופון. |
outputAudioConfig |
זה שינוי אופציונלי. הגדרות ליצירת פלט האודיו. |
evaluationChannel |
זה שינוי אופציונלי. הערוץ שרוצים להעריך. |
toolCallBehaviour |
זה שינוי אופציונלי. קובע אם ההערכה צריכה להשתמש בקריאות אמיתיות לכלים או בכלים מזויפים. |
InputAudioConfig
| ייצוג JSON |
|---|
{
"audioEncoding": enum ( |
| שדות | |
|---|---|
audioEncoding |
חובה. הקידוד של נתוני האודיו של הקלט. |
sampleRateHertz |
חובה. תדירות הדגימה (בהרץ) של נתוני האודיו של הקלט. |
noiseSuppressionLevel |
זה שינוי אופציונלי. האם להפעיל סינון רעשים באודיו של הקלט. הערכים האפשריים הם low, moderate, high, very_high. |
OutputAudioConfig
| ייצוג JSON |
|---|
{
"audioEncoding": enum ( |
| שדות | |
|---|---|
audioEncoding |
חובה. הקידוד של נתוני האודיו של הפלט. |
sampleRateHertz |
חובה. תדירות הדגימה (בהרץ) של נתוני האודיו של הפלט. |
EvaluationMetricsConfig
| ייצוג JSON |
|---|
{ "goldenMetricsConfig": { object ( |
| שדות | |
|---|---|
goldenMetricsConfig |
זה שינוי אופציונלי. הגדרות של המדדים המרכזיים להערכה. |
scenarioMetricsConfig |
זה שינוי אופציונלי. הגדרות מדדי התרחיש להערכה. |
GoldenMetricsConfig
| ייצוג JSON |
|---|
{ "semanticSimilarityMetricsConfig": { object ( |
| שדות | |
|---|---|
semanticSimilarityMetricsConfig |
זה שינוי אופציונלי. הגדרה גלובלית של מדדים של דמיון סמנטי. |
toolCorrectnessMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדי דיוק של כלי ברמת התור. |
stepToolCorrectnessMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדי דיוק של כלי ברמת השלב. |
ToolCorrectnessMetricsConfig
| ייצוג JSON |
|---|
{ "enableToolCorrectnessMetrics": boolean } |
| שדות | |
|---|---|
enableToolCorrectnessMetrics |
זה שינוי אופציונלי. האם לחשב מדדי נכונות של הכלי לצורך ההערכה. |
ScenarioMetricsConfig
| ייצוג JSON |
|---|
{ "userGoalMetMetricsConfig": { object ( |
| שדות | |
|---|---|
userGoalMetMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדים של השגת יעדים עסקיים ברמת המשתמש. |
expectationsMetMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדים של רמת הציפיות. |
UserGoalMetMetricsConfig
| ייצוג JSON |
|---|
{ "enableUserGoalMetMetrics": boolean } |
| שדות | |
|---|---|
enableUserGoalMetMetrics |
זה שינוי אופציונלי. האם לחשב את מדדי היעד שהמשתמש השיג לצורך ההערכה. |
ExpectationsMetMetricsConfig
| ייצוג JSON |
|---|
{ "enableExpectationsMetMetrics": boolean } |
| שדות | |
|---|---|
enableExpectationsMetMetrics |
זה שינוי אופציונלי. האם לחשב את מדדי רמת הציפיות להערכה. |
NullValue
מייצג JSON null.
NullValue הוא ערך שמירה, שמשתמש בערך מספרי עם ערך אחד בלבד כדי לייצג את ערך ה-null עבור איחוד הסוגים Value.
שדה מסוג NullValue עם ערך כלשהו שאינו 0 נחשב לא תקין. רוב כלי הסריאליזציה של ProtoJSON יפלטו Value עם null_value שמוגדר כ-null JSON בלי קשר לערך המספרי, ולכן יבצעו המרה הלוך ושוב לערך 0.
| טיפוסים בני מנייה (enum) | |
|---|---|
NULL_VALUE |
ערך null. |
ComparisonType
סוגי ההשוואה הנתמכים לבדיקת התשובה של הסוכן.
| טיפוסים בני מנייה (enum) | |
|---|---|
COMPARISON_TYPE_UNSPECIFIED |
סוג השוואה לא צוין. ההתנהגות מוגדרת כברירת מחדל ל-SEMANTIC_SIMILARITY לתגובות של סוכנים ולקריאות כלים. |
EQUALS |
התאמה מדויקת של מחרוזת. |
CONTAINS |
התאמה של מחרוזת משנה (בודקת אם המחרוזת הצפויה כלולה בתשובה בפועל). |
SEMANTIC_SIMILARITY |
התאמה של דמיון סמנטי (הערכת דמיון במשמעות באמצעות LLM). |
SemanticSimilarityChannel
הערוץ שבו רוצים להשתמש לדמיון סמנטי.
| טיפוסים בני מנייה (enum) | |
|---|---|
SEMANTIC_SIMILARITY_CHANNEL_UNSPECIFIED |
לא צוין מדד. ברירת המחדל היא TEXT. |
TEXT |
שימוש בדמיון סמנטי בין טקסטים. |
AUDIO |
שימוש בדמיון סמנטי של אודיו. |
HallucinationMetricBehavior
ההתנהגות של מדד ההזיות. ללא קשר להתנהגות, המדד תמיד יחושב. ההבדל הוא שכשהמדד מושבת, הוא לא משמש לחישוב הציון הכולל של ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
HALLUCINATION_METRIC_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת של מדד הזיות. |
DISABLED |
השבתה של מדד ההזיות. |
ENABLED |
הפעלת מדד ההזיות. |
TaskCompletionBehavior
ההתנהגות הצפויה של משימת המשתמש. המידע הזה משמש כדי לקבוע אם התרחיש הצליח.
| טיפוסים בני מנייה (enum) | |
|---|---|
TASK_COMPLETION_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת. ברירת המחדל היא TASK_SATISFIED. |
TASK_SATISFIED |
משימת המשתמש צריכה להסתיים בהצלחה. |
TASK_REJECTED |
צריך לדחות את משימת המשתמש. |
UserGoalBehavior
ההתנהגות הצפויה של המשתמש ביחס ליעד. המידע הזה משמש כדי לקבוע אם התרחיש הצליח.
| טיפוסים בני מנייה (enum) | |
|---|---|
USER_GOAL_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת. ברירת המחדל היא USER_GOAL_SATISFIED. |
USER_GOAL_SATISFIED |
המטרה של המשתמש צריכה להסתיים בהצלחה. |
USER_GOAL_REJECTED |
צריך לדחות את יעד המשתמש. |
USER_GOAL_IGNORED |
מתעלמים מהסטטוס של היעד של המשתמש. |
ScenarioExecutionMode
מצב ההרצה של הערכות התרחישים.
| טיפוסים בני מנייה (enum) | |
|---|---|
SCENARIO_EXECUTION_MODE_UNSPECIFIED |
מצב ביצוע לא מוגדר. ברירת המחדל היא QUALITY_OPTIMIZED. |
QUALITY_OPTIMIZED |
מצב אופטימיזציה לאיכות. |
SPEED_OPTIMIZED |
מצב אופטימיזציה למהירות. |
תוצאת הסריקה
התוצאה של הבדיקה או הציפייה.
| טיפוסים בני מנייה (enum) | |
|---|---|
OUTCOME_UNSPECIFIED |
תוצאת ההערכה לא צוינה. |
PASS |
ההערכה או הציפייה עברו. במקרה של הערכה, המשמעות היא שכל הציפיות התממשו. |
FAIL |
ההערכה או הציפייה נכשלו. במקרה של הערכה, המשמעות היא שלפחות ציפייה אחת לא התממשה. |
SKIPPED |
דילוג על הערכה/ציפייה. |
ErrorType
סוג השגיאה
| טיפוסים בני מנייה (enum) | |
|---|---|
ERROR_TYPE_UNSPECIFIED |
סוג שגיאה לא מזוהה. |
RUNTIME_FAILURE |
הייתה שגיאה במהלך ההרצה. |
CONVERSATION_RETRIEVAL_FAILURE |
הייתה בעיה והשיחה לא אוחזרה מ-CES Runtime. |
METRIC_CALCULATION_FAILURE |
לא הצלחנו לחשב מדד או תוצאה. |
EVALUATION_UPDATE_FAILURE |
עדכון ההערכה נכשל. |
QUOTA_EXHAUSTED |
הגעתם למכסה. |
USER_SIMULATION_FAILURE |
הייתה שגיאה במהלך סימולציית המשתמשים. |
סוג
סוג הטווח. יכול להיות שבעתיד נוסיף עוד ערכים.
| טיפוסים בני מנייה (enum) | |
|---|---|
TYPE_UNSPECIFIED |
ערך ברירת המחדל. הערך הזה לא בשימוש. |
TOOL |
טווח של קריאה לכלי. |
USER_CALLBACK |
משך הזמן של שיחת משתמש חוזרת. |
GUARDRAIL |
טווח שכבות ההגנה. |
LLM |
טווח LLM. |
BackgroundEnvironment
סביבת אודיו מדומה.
| טיפוסים בני מנייה (enum) | |
|---|---|
BACKGROUND_ENVIRONMENT_UNSPECIFIED |
לא צוינה סביבת רקע. |
CALL_CENTER |
סביבת מוקד טלפוני. |
TRAFFIC |
סביבה עם רעשי תנועה. |
KIDS_NOISE |
סביבה רועשת של ילדים. |
CAFE |
סביבת בית קפה. |
ExecutionState
המצב של ביצוע תוצאת ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
EXECUTION_STATE_UNSPECIFIED |
לא צוין מצב הביצוע של תוצאת ההערכה. |
QUEUED |
ההפעלה של תוצאת ההערכה ממתינה בתור. |
RUNNING |
ההרצה של תוצאת ההערכה מתבצעת. |
COMPLETED |
ההרצה של תוצאת ההערכה הסתיימה. |
ERROR |
הביצוע של תוצאת ההערכה נכשל בגלל שגיאה פנימית. |
CANCELLED |
ההרצה של תוצאת ההערכה בוטלה. |
ExtraToolCallBehavior
ההגדרה הזו מגדירה את ההתנהגות כשנתקלים בקריאה נוספת לכלי. קריאה נוספת לכלי היא קריאה לכלי שקיימת בהרצה אבל לא תואמת לאף קריאה לכלי בציפייה המוזהבת.
| טיפוסים בני מנייה (enum) | |
|---|---|
EXTRA_TOOL_CALL_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת. ברירת המחדל היא FAIL. |
FAIL |
הבדיקה תיכשל אם יזוהה קריאה נוספת לכלי. |
ALLOW |
מאשרים את השימוש בכלי הנוסף. |
AudioEncoding
המאפיין AudioEncoding מציין את פורמט הקידוד של נתוני האודיו.
| טיפוסים בני מנייה (enum) | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
קידוד אודיו שלא צוין. |
LINEAR16 |
קידוד אודיו PCM ליניארי של 16 ביט. |
MULAW |
דגימות של 8 ביט שמרחיבות דגימות אודיו של 14 ביט באמצעות G.711 PCMU/mu-law. |
ALAW |
דגימות של 8 ביט שמרחיבות דגימות אודיו של 14 ביט באמצעות G.711 PCMU/A-law. |
EvaluationChannel
הערוץ שרוצים להעריך.
| טיפוסים בני מנייה (enum) | |
|---|---|
EVALUATION_CHANNEL_UNSPECIFIED |
ערוץ הערכה לא מוגדר. |
TEXT |
ערוץ הערכה מסוג טקסט בלבד. |
AUDIO |
ערוץ להערכת אודיו. |
EvaluationToolCallBehaviour
הגדרת אופן הפעולה של קריאות לכלי בהרצות של הערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
EVALUATION_TOOL_CALL_BEHAVIOUR_UNSPECIFIED |
התנהגות לא מוגדרת של קריאה לכלי. ברירת המחדל היא שימוש בקריאות אמיתיות לכלי. |
REAL |
שימוש בקריאות אמיתיות לכלי. |
FAKE |
שימוש בקריאות מזויפות לכלים. |
GoldenRunMethod
השיטה שבה נעשה שימוש להפעלת ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
GOLDEN_RUN_METHOD_UNSPECIFIED |
לא צוינה שיטת ההפעלה. |
STABLE |
מריצים את ההערכה כהפעלה חוזרת יציבה, שבה כל תור הוא סשן ייחודי עם התורות הקודמות הצפויות שמוזרקות כהקשר. |
NAIVE |
מריצים את ההערכה כהפעלה חוזרת פשוטה, שבה ההפעלה היא סשן יחיד ללא הקשר מוזרק. |
OutcomeMetadata
מטא-נתונים לגבי תוצאת ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
OUTCOME_METADATA_UNSPECIFIED |
מטא-נתונים לא מוגדרים של התוצאה. |
GRACEFUL_HANDOFF |
ההערכה הובילה להעברה חלקה לנציג אנושי. |
סכימת הפלט
הערכה מייצגת את כל המידע שנדרש כדי לדמות סוכן ולהעריך אותו.
הערכה
| ייצוג JSON |
|---|
{ "name": string, "displayName": string, "description": string, "tags": [ string ], "evaluationDatasets": [ string ], "createTime": string, "createdBy": string, "updateTime": string, "lastUpdatedBy": string, "evaluationRuns": [ string ], "etag": string, "aggregatedMetrics": { object ( |
| שדות | |
|---|---|
name |
מזהה. המזהה הייחודי של ההערכה. פורמט: |
displayName |
חובה. שם התצוגה שהמשתמש נתן להערכה. ייחודי באפליקציה. |
description |
זה שינוי אופציונלי. תיאור שהמשתמש מגדיר לגבי ההערכה. |
tags[] |
זה שינוי אופציונלי. תגים שהוגדרו על ידי המשתמש לסיווג הבדיקה. |
evaluationDatasets[] |
פלט בלבד. רשימה של מערכי נתונים להערכה שההערכה שייכת להם. פורמט: |
createTime |
פלט בלבד. חותמת הזמן שבה נוצרה ההערכה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
createdBy |
פלט בלבד. המשתמש שיצר את ההערכה. |
updateTime |
פלט בלבד. חותמת זמן של מועד העדכון האחרון של ההערכה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
lastUpdatedBy |
פלט בלבד. המשתמש שעדכן לאחרונה את ההערכה. |
evaluationRuns[] |
פלט בלבד. ה-EvaluationRuns שההערכה הזו משויכת אליהם. |
etag |
פלט בלבד. תג Etag שמשמש כדי לוודא שהאובייקט לא השתנה במהלך פעולת קריאה-שינוי-כתיבה. אם ה-etag ריק, העדכון ידרוס את כל השינויים שמתבצעים בו-זמנית. |
aggregatedMetrics |
פלט בלבד. המדדים המצטברים של ההערכה הזו בכל ההרצות. |
lastCompletedResult |
פלט בלבד. תוצאת ההערכה האחרונה של ההערכה הזו. |
invalid |
פלט בלבד. האם ההערכה לא תקינה. מצב כזה יכול לקרות אם ההערכה מתייחסת לכלי, לערכת כלים או לנציג שנמחקו מאז. |
lastTenResults[] |
פלט בלבד. 10 התוצאות האחרונות של ההערכה הזו. השדה הזה מאוכלס רק אם הערך של include_last_ten_results מוגדר כ-True ב-ListEvaluationsRequest או ב-GetEvaluationRequest. |
evaluationMetricsThresholdOverride |
זה שינוי אופציונלי. ביטול של ספי מדדים להערכה הספציפית הזו. |
evaluationMetricsConfigOverride |
זה שינוי אופציונלי. הגדרה שמשנה את הגדרות המדדים להערכה הספציפית הזו. |
שדה איחוד inputs. הערך של inputs יכול להיות רק אחד מהבאים: |
|
golden |
זה שינוי אופציונלי. השלבים החשובים שצריך לבדוק. |
scenario |
זה שינוי אופציונלי. ההגדרה של תרחיש. |
זהוב
| ייצוג JSON |
|---|
{
"turns": [
{
object ( |
| שדות | |
|---|---|
turns[] |
חובה. מספר התורות הנדרש כדי להפעיל מחדש שיחה מוזהבת. המספר המקסימלי של תורות שמותר הוא 100. |
evaluationExpectations[] |
זה שינוי אופציונלי. הציפיות להערכה שעל פיהן תתבצע הערכה של השיחה שהופעלה מחדש. פורמט: |
GoldenTurn
| ייצוג JSON |
|---|
{ "steps": [ { object ( |
| שדות | |
|---|---|
steps[] |
חובה. השלבים שנדרשים כדי להפעיל מחדש שיחה לדוגמה. |
rootSpan |
זה שינוי אופציונלי. יחידה לוגית למעקב הבסיסית של התור הזהב לעיבוד ולשמירה של מידע אודיו. ה-URI של האודיו חייב להכיל אודיו שנשמר בתדירות דגימה של 16KHz. |
turnLevelMetricsThresholdsOverride |
זה שינוי אופציונלי. הגדרות שמשנות את ערכי הסף של המדדים ברמת התור. |
hallucinationMetricBehaviorOverride |
זה שינוי אופציונלי. שינוי ברירת המחדל של התנהגות מדד ההזיות ברמת התור. |
שלב
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד step. השלב לביצוע. הערך step יכול להיות רק אחד מהבאים: |
|
userInput |
זה שינוי אופציונלי. קלט של משתמשים לשיחה. |
agentTransfer |
זה שינוי אופציונלי. העברת השיחה לסוכן אחר. |
expectation |
זה שינוי אופציונלי. מריץ ציפייה בתור הנוכחי. |
SessionInput
| ייצוג JSON |
|---|
{ "willContinue": boolean, // Union field |
| שדות | |
|---|---|
willContinue |
זה שינוי אופציונלי. סימון שמציין אם ההודעה הנוכחית היא קטע מקלט גדול יותר בסשן סטרימינג דו-כיווני. אם הערך הוא הערה: השדה הזה לא רלוונטי לקלט של אודיו ו-DTMF, כי הם תמיד מעובדים באופן אוטומטי על סמך אות סיום השיחה. |
שדה איחוד input_type. סוג הקלט. הערך input_type יכול להיות רק אחד מהבאים: |
|
text |
זה שינוי אופציונלי. נתוני טקסט ממשתמש הקצה. |
dtmf |
זה שינוי אופציונלי. ספרות DTMF ממשתמש הקצה. |
audio |
זה שינוי אופציונלי. נתוני אודיו ממשתמש הקצה. מחרוזת בקידוד Base64. |
toolResponses |
זה שינוי אופציונלי. תוצאות ההרצה של קריאות הכלים מהלקוח. |
image |
זה שינוי אופציונלי. נתוני תמונות ממשתמש הקצה. |
blob |
זה שינוי אופציונלי. נתוני Blob ממשתמש הקצה. |
variables |
זה שינוי אופציונלי. משתנים לפי הקשר של הסשן, עם מפתח לפי שם. הנציג של CES ישתמש רק במשתנים שהוגדרו באפליקציה. משתנים לא מזוהים עדיין יישלחו אל [הנציג של Dialogflow][Agent.RemoteDialogflowAgent] כפרמטרים נוספים של הסשן. |
event |
זה שינוי אופציונלי. קלט האירוע. |
ToolResponses
| ייצוג JSON |
|---|
{
"toolResponses": [
{
object ( |
| שדות | |
|---|---|
toolResponses[] |
זה שינוי אופציונלי. רשימת תוצאות ההרצה של הכלי. |
ToolResponse
| ייצוג JSON |
|---|
{ "id": string, "displayName": string, "response": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| שדות | |
|---|---|
id |
זה שינוי אופציונלי. מזהה התשובה התואם של |
displayName |
פלט בלבד. השם המוצג של הכלי. |
response |
חובה. תוצאת ההפעלה של הכלי בפורמט אובייקט JSON. משתמשים במפתח 'output' כדי לציין את התגובה של הכלי ובמפתח 'error' כדי לציין את פרטי השגיאה (אם יש). אם לא מציינים את המפתחות 'פלט' ו'שגיאה', המערכת מתייחסת לכל התגובה כתוצאה של הפעלת הכלי. |
parentToolCallId |
פלט בלבד. המזהה של קריאת הכלי שגרמה לקריאה הזו, כשהיא הונפקה על ידי סוכן משנה שפועל בשם קריאת הורה. השדה ריק עבור שיחות ברמה העליונה. מאפשר ללקוח לקבץ את העבודה של סוכן משנה תחת השיחה שהתחילה אותה, במקום להציג כל שלב כפריט באותה רמה. |
agentName |
פלט בלבד. השם של הסוכן שהנפיק את השיחה הזו, בפורמט שקריא לבני אדם, למשל Contract Architect. השדה ריק אם הסוכן הבסיסי הנפיק את ה-ID. |
שדה איחוד tool_identifier. המזהה של הכלי שהופעל. יכול להיות שמדובר בכלי קבוע או בכלי מתוך ערכת כלים. הערך tool_identifier יכול להיות רק אחד מהבאים: |
|
tool |
זה שינוי אופציונלי. שם הכלי להפעלה. פורמט: |
toolsetTool |
זה שינוי אופציונלי. הכלי בערכת הכלים שהופעל. |
ToolsetTool
| ייצוג JSON |
|---|
{ "toolset": string, "toolId": string } |
| שדות | |
|---|---|
toolset |
חובה. שם המשאב של ערכת הכלים שממנה נגזר הכלי הזה. פורמט: |
toolId |
זה שינוי אופציונלי. מזהה הכלי לסינון הכלים כדי לאחזר את הסכימה שלהם. |
Struct
| ייצוג JSON |
|---|
{ "fields": { string: value, ... } } |
| שדות | |
|---|---|
fields |
מפה לא מסודרת של ערכים עם הקלדה דינמית. אובייקט שמכיל רשימה של |
FieldsEntry
| ייצוג JSON |
|---|
{ "key": string, "value": value } |
| שדות | |
|---|---|
key |
|
value |
|
ערך
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד kind. סוג הערך. הערך kind יכול להיות רק אחד מהבאים: |
|
nullValue |
מייצג JSON |
numberValue |
מייצג מספר JSON. הערך לא יכול להיות |
stringValue |
מייצג מחרוזת JSON. |
boolValue |
מייצג ערך בוליאני ב-JSON (הליטרלים |
structValue |
מייצג אובייקט JSON. |
listValue |
מייצג מערך JSON. |
ListValue
| ייצוג JSON |
|---|
{ "values": [ value ] } |
| שדות | |
|---|---|
values[] |
שדה חוזר של ערכים עם הקלדה דינמית. |
תמונה
| ייצוג JSON |
|---|
{ "mimeType": string, "data": string } |
| שדות | |
|---|---|
mimeType |
חובה. סוג ה-MIME התקני של IANA של נתוני המקור. סוגי התמונות הנתמכים כוללים: * image/png * image/jpeg * image/webp |
data |
חובה. בייטים גולמיים של התמונה. מחרוזת בקידוד Base64. |
Blob
| ייצוג JSON |
|---|
{ "mimeType": string, "data": string } |
| שדות | |
|---|---|
mimeType |
חובה. סוג ה-MIME התקני של IANA של נתוני המקור. |
data |
חובה. בייטים גולמיים של ה-blob. מחרוזת בקידוד Base64. |
אירוע
| ייצוג JSON |
|---|
{ "event": string } |
| שדות | |
|---|---|
event |
חובה. שם האירוע. |
AgentTransfer
| ייצוג JSON |
|---|
{ "targetAgent": string, "displayName": string } |
| שדות | |
|---|---|
targetAgent |
חובה. הסוכן שאליו מועברת השיחה. הנציג יטפל בשיחה מעכשיו והלאה. פורמט: |
displayName |
פלט בלבד. השם המוצג של הסוכן. |
GoldenExpectation
| ייצוג JSON |
|---|
{ "note": string, "skipEvaluation": boolean, "expectationLevelMetricsThresholdsOverride": { object ( |
| שדות | |
|---|---|
note |
זה שינוי אופציונלי. הערה לגבי הדרישה הזו, שיכולה לעזור לכם לדווח על מקרים שבהם בדיקות ספציפיות נכשלות. למשל, "Check_Payment_Tool_Called". |
skipEvaluation |
זה שינוי אופציונלי. אם הערך מוגדר כ-true, הציפייה הספציפית הזו לא תיבדק. |
expectationLevelMetricsThresholdsOverride |
זה שינוי אופציונלי. מבטל את המדדים ברמת השלב. |
agentResponseSemanticSimilarityMetricsConfigOverride |
זה שינוי אופציונלי. הגדרות ברירת מחדל לשינוי מדדי הדמיון הסמנטי של agent_response. |
agentResponseHallucinationMetricsConfigOverride |
זה שינוי אופציונלי. שינויים במדדים של הזיות בתשובות של סוכנים. |
comparisonType |
זה שינוי אופציונלי. סוג ההשוואה שמשמש לבדיקת הציפייה. |
שדה איחוד condition. הבדיקה בפועל שצריך לבצע. הערך condition יכול להיות רק אחד מהבאים: |
|
toolCall |
זה שינוי אופציונלי. בודקים אם בוצעה קריאה לכלי ספציפי עם הפרמטרים. |
toolResponse |
זה שינוי אופציונלי. בודקים אם כלי ספציפי הגיב בצורה הצפויה. |
agentResponse |
זה שינוי אופציונלי. בודקים שהנציג הווירטואלי הגיב בתשובה הנכונה. התפקיד 'סוכן' מרומז. |
agentTransfer |
זה שינוי אופציונלי. בודקים שהנציג העביר את השיחה לנציג אחר. |
updatedVariables |
זה שינוי אופציונלי. בודקים שהסוכן עדכן את משתני הסשן לערכים הצפויים. הוא שימש גם לתיעוד של עדכוני משתנים של סוכנים לצורך הערכות מוזהבות. |
mockToolResponse |
זה שינוי אופציונלי. התגובה של הכלי ל-mock, עם הפרמטרים שמעניינים אתכם. כל הפרמטרים שלא צוינו יומצאו על ידי ה-LLM. |
noToolCalls |
זה שינוי אופציונלי. בודקים שלא נעשה שימוש בכלים במהלך התור הזה. |
ToolCall
| ייצוג JSON |
|---|
{ "id": string, "displayName": string, "args": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| שדות | |
|---|---|
id |
זה שינוי אופציונלי. המזהה הייחודי של קריאת הכלי. אם השדה מאוכלס, הלקוח צריך להחזיר את תוצאת ההפעלה עם המזהה התואם בשדה |
displayName |
פלט בלבד. השם המוצג של הכלי. |
args |
זה שינוי אופציונלי. פרמטרי הקלט והערכים של הכלי בפורמט אובייקט JSON. |
parentToolCallId |
פלט בלבד. המזהה של קריאת הכלי שגרמה לקריאה הזו, כשהיא הונפקה על ידי סוכן משנה שפועל בשם קריאת הורה. השדה ריק עבור שיחות ברמה העליונה. מאפשר ללקוח לקבץ את העבודה של סוכן משנה תחת השיחה שהתחילה אותה, במקום להציג כל שלב כפריט באותה רמה. |
agentName |
פלט בלבד. השם של הסוכן שהנפיק את השיחה הזו, בפורמט שקריא לבני אדם, למשל Contract Architect. השדה ריק אם הסוכן הבסיסי הנפיק את ה-ID. |
שדה איחוד tool_identifier. המזהה של הכלי להפעלה. יכול להיות שמדובר בכלי קבוע או בכלי מתוך ערכת כלים. הערך tool_identifier יכול להיות רק אחד מהבאים: |
|
tool |
זה שינוי אופציונלי. שם הכלי להפעלה. פורמט: |
toolsetTool |
זה שינוי אופציונלי. הכלי להרצה בערכת הכלים. |
הודעה
| ייצוג JSON |
|---|
{
"role": string,
"chunks": [
{
object ( |
| שדות | |
|---|---|
role |
זה שינוי אופציונלי. התפקיד בשיחה, למשל: משתמש, נציג. |
chunks[] |
זה שינוי אופציונלי. תוכן ההודעה כסדרה של נתחים. |
eventTime |
זה שינוי אופציונלי. חותמת הזמן שבה ההודעה נשלחה או התקבלה. אסור להשתמש בערך הזה אם ההודעה היא חלק מ הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
חלק
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד data. לחלק את הנתונים לחלקים. הערך data יכול להיות רק אחד מהבאים: |
|
text |
זה שינוי אופציונלי. נתוני טקסט. |
transcript |
זה שינוי אופציונלי. תמליל שמשויך לאודיו. |
blob |
זה שינוי אופציונלי. נתוני Blob. |
payload |
זה שינוי אופציונלי. נתונים של מטען ייעודי בהתאמה אישית. |
image |
זה שינוי אופציונלי. נתוני תמונה. |
toolCall |
זה שינוי אופציונלי. בקשה להרצת כלי. |
toolResponse |
זה שינוי אופציונלי. תשובה להרצת הכלי. |
agentTransfer |
זה שינוי אופציונלי. אירוע העברה של סוכן. |
updatedVariables |
מבנה נתונים מייצג משתנים שעודכנו בשיחה, עם מפתחות לפי שמות המשתנים. |
defaultVariables |
מבנה נתונים מייצג משתני ברירת מחדל בתחילת השיחה, עם מפתחות לפי שמות המשתנים. |
חותמת הזמן
| ייצוג JSON |
|---|
{ "seconds": string, "nanos": integer } |
| שדות | |
|---|---|
seconds |
מייצג את השניות של זמן UTC מאז ראשית זמן יוניקס (Unix epoch) 1970-01-01T00:00:00Z. הערך חייב להיות בין -62135596800 ל-253402300799, כולל (שמתאים לטווח 0001-01-01T00:00:00Z עד 9999-12-31T23:59:59Z). |
nanos |
שבריר לא שלילי של שנייה ברזולוציית ננו-שנייה. השדה הזה מייצג את החלק של משך הזמן בננו-שניות, ולא מהווה חלופה לשניות. ערכי שניות שליליים עם שברים עדיין צריכים לכלול ערכי ננו-שניות לא שליליים שסופרים קדימה בזמן. הערך חייב להיות בין 0 ל-999,999,999, כולל. |
ExpectationLevelMetricsThresholds
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד הערך |
|
toolInvocationParameterCorrectnessThreshold |
זה שינוי אופציונלי. סף ההצלחה לפרמטרים נפרדים של הפעלת כלי. חייב להיות מספר עשרוני בין 0 ל-1. ברירת המחדל היא 1.0. |
SemanticSimilarityMetricsConfig
| ייצוג JSON |
|---|
{ "enableSemanticSimilarityMetrics": boolean } |
| שדות | |
|---|---|
enableSemanticSimilarityMetrics |
זה שינוי אופציונלי. האם לחשב מדדים של דמיון סמנטי לצורך ההערכה. |
HallucinationMetricsConfig
| ייצוג JSON |
|---|
{ "enableHallucinationMetrics": boolean } |
| שדות | |
|---|---|
enableHallucinationMetrics |
זה שינוי אופציונלי. האם לחשב מדדי הזיות לצורך ההערכה. |
Span
| ייצוג JSON |
|---|
{
"name": string,
"startTime": string,
"endTime": string,
"duration": string,
"attributes": {
object
},
"childSpans": [
{
object ( |
| שדות | |
|---|---|
name |
פלט בלבד. השם של ה-span. |
startTime |
פלט בלבד. שעת ההתחלה של טווח הזמן. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
endTime |
פלט בלבד. שעת הסיום של טווח הזמן. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
duration |
פלט בלבד. משך הזמן של הטווח. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
attributes |
פלט בלבד. מאפייני מפתח/ערך שמשויכים לטווח. |
childSpans[] |
פלט בלבד. טווחים משניים שמוטמעים בטווח הזה. |
משך
| ייצוג JSON |
|---|
{ "seconds": string, "nanos": integer } |
| שדות | |
|---|---|
seconds |
מספר השניות עם סימן של טווח הזמן. הערך חייב להיות בין -315,576,000,000 לבין +315,576,000,000, כולל. הערה: הגבולות האלה מחושבים לפי: 60 שניות בדקה * 60 דקות בשעה * 24 שעות ביממה * 365.25 ימים בשנה * 10,000 שנים |
nanos |
שברים חתומים של שנייה ברזולוציית ננו-שנייה של טווח הזמן. משכי זמן של פחות משנייה אחת מיוצגים באמצעות שדה |
TurnLevelMetricsThresholds
| ייצוג JSON |
|---|
{ "semanticSimilarityChannel": enum ( |
| שדות | |
|---|---|
semanticSimilarityChannel |
זה שינוי אופציונלי. הערוץ של הדמיון הסמנטי שבו רוצים להשתמש להערכה. |
שדה איחוד הערך |
|
semanticSimilaritySuccessThreshold |
זה שינוי אופציונלי. סף ההצלחה לדמיון סמנטי. חייב להיות מספר שלם בין 0 ל-4. ברירת המחדל היא >= 3. |
שדה איחוד הערך |
|
overallToolInvocationCorrectnessThreshold |
זה שינוי אופציונלי. סף ההצלחה לדיוק הכולל של הפעלת הכלי. חייב להיות מספר עשרוני בין 0 ל-1. ברירת המחדל היא 1.0. |
תרחיש
| ייצוג JSON |
|---|
{ "task": string, "userFacts": [ { object ( |
| שדות | |
|---|---|
task |
חובה. המשימה שהתרחיש יתמקד בה. |
userFacts[] |
זה שינוי אופציונלי. העובדות על המשתמש שבהן התרחיש ישתמש. |
maxTurns |
זה שינוי אופציונלי. מספר הפניות המקסימלי לסימולציה. הערך המקסימלי המותר הוא 100. ערך ברירת המחדל הוא 100. |
rubrics[] |
חובה. קריטריונים לדירוג התרחיש. |
scenarioExpectations[] |
חובה. ה-ScenarioExpectations להערכת השיחה שנוצרה על ידי סימולציית המשתמש. |
variableOverrides |
זה שינוי אופציונלי. משתנים / פרמטרים של סשן כהקשר לסשן, עם מפתח לפי שמות המשתנים. הערכים של המשתנים האלה יחליפו את ערכי ברירת המחדל שהוגדרו על ידי המערכת. הערה: אלה עובדות שונות מעובדות על המשתמש, שהן עובדות שהמשתמש מכיר. משתנים הם פרמטרים שהסוכן מכיר: כלומר, MDN (מספר טלפון) שמועבר על ידי מערכת הטלפוניה. |
taskCompletionBehavior |
זה שינוי אופציונלי. הוצאה משימוש, במקום זאת, צריך להשתמש במאפיין user_goal_behavior. |
userGoalBehavior |
זה שינוי אופציונלי. ההתנהגות הצפויה של המשתמש ביחס ליעד. |
evaluationExpectations[] |
זה שינוי אופציונלי. הציפיות להערכה שמשמשות להערכת השיחה שנוצרה על ידי הסימולציה. פורמט: |
scenarioExecutionMode |
זה שינוי אופציונלי. מצב ההרצה של הערכות התרחישים. |
UserFact
| ייצוג JSON |
|---|
{ "name": string, "value": string } |
| שדות | |
|---|---|
name |
חובה. השם של עובדת המשתמש. |
value |
חובה. הערך של נתון המשתמש. |
ScenarioExpectation
| ייצוג JSON |
|---|
{ // Union field |
| שדות | |
|---|---|
שדה איחוד expectation. הציפייה להערכת השיחה שנוצרה על ידי הסימולציה. הערך expectation יכול להיות רק אחד מהבאים: |
|
toolExpectation |
זה שינוי אופציונלי. הזוג של קריאה לכלי ותגובה שצריך להעריך. |
agentResponse |
זה שינוי אופציונלי. תשובת הסוכן שצריך להעריך. |
ToolExpectation
| ייצוג JSON |
|---|
{ "expectedToolCall": { object ( |
| שדות | |
|---|---|
expectedToolCall |
חובה. הקריאה הצפויה לכלי, עם הפרמטרים הרלוונטיים שצוינו. כל הפרמטרים שלא צוינו יומצאו על ידי ה-LLM. |
mockToolResponse |
חובה. התגובה של הכלי ל-mock, עם הפרמטרים שמעניינים אתכם. כל הפרמטרים שלא צוינו יומצאו על ידי ה-LLM. |
AggregatedMetrics
| ייצוג JSON |
|---|
{
"metricsByAppVersion": [
{
object ( |
| שדות | |
|---|---|
metricsByAppVersion[] |
פלט בלבד. מדדים מצטברים, מקובצים לפי מזהה גרסת האפליקציה. |
MetricsByAppVersion
| ייצוג JSON |
|---|
{ "appVersionId": string, "toolMetrics": [ { object ( |
| שדות | |
|---|---|
appVersionId |
פלט בלבד. מזהה גרסת האפליקציה. |
toolMetrics[] |
פלט בלבד. מדדים לכל כלי בגרסה הזו של האפליקציה. |
semanticSimilarityMetrics[] |
פלט בלבד. מדדים לדמיון סמנטי בגרסת האפליקציה הזו. |
hallucinationMetrics[] |
פלט בלבד. מדדים להזיות בגרסת האפליקציה הזו. |
toolCallLatencyMetrics[] |
פלט בלבד. מדדים של זמן האחזור של קריאות לכלי בגרסה הזו של האפליקציה. |
turnLatencyMetrics[] |
פלט בלבד. מדדים של זמן התגובה בגרסת האפליקציה הזו. |
passCount |
פלט בלבד. מספר הפעמים שההערכה עברה. |
failCount |
פלט בלבד. מספר הפעמים שההערכה נכשלה. |
metricsByTurn[] |
פלט בלבד. מדדים מצטברים לכל תור בגרסת האפליקציה הזו. |
ToolMetrics
| ייצוג JSON |
|---|
{ "tool": string, "passCount": integer, "failCount": integer } |
| שדות | |
|---|---|
tool |
פלט בלבד. שם הכלי. |
passCount |
פלט בלבד. מספר הפעמים שהכלי עבר. |
failCount |
פלט בלבד. מספר הפעמים שהכלי נכשל. |
SemanticSimilarityMetrics
| ייצוג JSON |
|---|
{ "score": number } |
| שדות | |
|---|---|
score |
פלט בלבד. הציון הממוצע של הדמיון הסמנטי (0-4). |
HallucinationMetrics
| ייצוג JSON |
|---|
{ "score": number } |
| שדות | |
|---|---|
score |
פלט בלבד. הציון הממוצע של הזיות (0 עד 1). |
ToolCallLatencyMetrics
| ייצוג JSON |
|---|
{ "tool": string, "averageLatency": string } |
| שדות | |
|---|---|
tool |
פלט בלבד. שם הכלי. |
averageLatency |
פלט בלבד. החביון הממוצע של קריאות הכלים. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
TurnLatencyMetrics
| ייצוג JSON |
|---|
{ "averageLatency": string } |
| שדות | |
|---|---|
averageLatency |
פלט בלבד. זמן האחזור הממוצע של התורות. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
MetricsByTurn
| ייצוג JSON |
|---|
{ "turnIndex": integer, "toolMetrics": [ { object ( |
| שדות | |
|---|---|
turnIndex |
פלט בלבד. אינדקס הפנייה (מתחיל מ-0). |
toolMetrics[] |
פלט בלבד. מדדים לכל כלי בתור הזה. |
semanticSimilarityMetrics[] |
פלט בלבד. מדדים לדמיון סמנטי בתור הזה. |
hallucinationMetrics[] |
פלט בלבד. מדדים להזיות בתור הזה. |
toolCallLatencyMetrics[] |
פלט בלבד. מדדים של זמן האחזור של קריאה לכלי בתור הזה. |
turnLatencyMetrics[] |
פלט בלבד. מדדים של זמן הטעינה של התור הנוכחי. |
EvaluationResult
| ייצוג JSON |
|---|
{ "name": string, "displayName": string, "createTime": string, "evaluationStatus": enum ( |
| שדות | |
|---|---|
name |
מזהה. המזהה הייחודי של תוצאת הבדיקה. פורמט: |
displayName |
חובה. השם המוצג של תוצאת ההערכה. ייחודי בתוך הערכה. כברירת מחדל, הפורמט הוא: |
createTime |
פלט בלבד. חותמת הזמן שבה נוצרה תוצאת ההערכה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
evaluationStatus |
פלט בלבד. תוצאת ההערכה. השדה הזה מאוכלס רק אם execution_state הוא COMPLETE. |
evaluationRun |
פלט בלבד. הפעלת ההערכה שהניבה את התוצאה הזו. פורמט: |
persona |
פלט בלבד. הפרסונה ששימשה ליצירת השיחה לתוצאת ההערכה. |
errorInfo |
פלט בלבד. פרטי השגיאה בתוצאת ההערכה. |
error |
פלט בלבד. הוצא משימוש: במקומו, צריך להשתמש ב- |
initiatedBy |
פלט בלבד. המשתמש שיזם את הרצת ההערכה שהניבה את התוצאה הזו. |
appVersion |
פלט בלבד. גרסת האפליקציה ששימשה ליצירת השיחה שהובילה לתוצאה הזו. פורמט: |
appVersionDisplayName |
פלט בלבד. השם המוצג של |
changelog |
פלט בלבד. יומן השינויים של גרסת האפליקציה שההערכה בוצעה לגביה. השדה הזה מאוכלס אם המשתמש מריץ הערכה בגרסה האחרונה או בטיוטה. |
changelogCreateTime |
פלט בלבד. זמן היצירה של יומן השינויים של גרסת האפליקציה שההערכה הופעלה לגביה. השדה הזה מאוכלס אם המשתמש מריץ הערכה בגרסה האחרונה או בטיוטה. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
executionState |
פלט בלבד. המצב של ביצוע תוצאת ההערכה. |
evaluationMetricsThresholds |
פלט בלבד. ספי הבדיקה של התוצאה. |
config |
פלט בלבד. ההגדרה שבה נעשה שימוש בהרצת ההערכה שהניבה את התוצאה הזו. |
goldenRunMethod |
פלט בלבד. השיטה שבה נעשה שימוש להפעלת הערכת הזהב. |
rootSpan |
פלט בלבד. יחידה לוגית למעקב ברמת הבסיס של הרצת ההערכה, שכוללת מידע על כל שלב בהערכה. |
outcomeMetadata |
פלט בלבד. מטא-נתונים של תוצאת הבדיקה. השדה הזה מאוכלס רק אם execution_state הוא COMPLETE. |
שדה איחוד result. התוצאה של ההערכה. השדה הזה מאוכלס רק כש-execution_state הוא COMPLETED. הערך result יכול להיות רק אחד מהבאים: |
|
goldenResult |
פלט בלבד. התוצאה של הערכת הזהב. |
scenarioResult |
פלט בלבד. התוצאה של הערכת תרחיש. |
GoldenResult
| ייצוג JSON |
|---|
{ "turnReplayResults": [ { object ( |
| שדות | |
|---|---|
turnReplayResults[] |
פלט בלבד. התוצאה של הרצת כל תור בשיחה המוזהבת. |
evaluationExpectationResults[] |
פלט בלבד. תוצאות הציפיות מההערכה. |
TurnReplayResult
| ייצוג JSON |
|---|
{ "conversation": string, "expectationOutcome": [ { object ( |
| שדות | |
|---|---|
conversation |
פלט בלבד. השיחה שנוצרה בתור הזה. |
expectationOutcome[] |
פלט בלבד. התוצאה של כל ציפייה. |
hallucinationResult |
פלט בלבד. התוצאה של בדיקת ההזיות. |
toolInvocationScore |
פלט בלבד. הוצאה משימוש, במקומו, צריך להשתמש ב-OverallToolInvocationResult. |
turnLatency |
פלט בלבד. משך התור. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
toolCallLatencies[] |
פלט בלבד. החביון של כל קריאה לכלי בתור. |
semanticSimilarityResult |
פלט בלבד. התוצאה של בדיקת הדמיון הסמנטי. |
overallToolInvocationResult |
פלט בלבד. התוצאה של הבדיקה הכוללת של הפעלת הכלי. |
errorInfo |
פלט בלבד. מידע על השגיאה שאירעה במהלך התור הזה. |
spanLatencies[] |
פלט בלבד. זמן האחזור של טווחי הזמן בפנייה. |
שדה איחוד הערך |
|
toolOrderedInvocationScore |
פלט בלבד. הציון הכולל של הפעלת הכלי בתור הזה. המדד הזה מציין את אחוז הכלים הכולל מתוך התור הצפוי שהופעלו בפועל בסדר הצפוי. |
GoldenExpectationOutcome
| ייצוג JSON |
|---|
{ "expectation": { object ( |
| שדות | |
|---|---|
expectation |
פלט בלבד. הציפייה שנבדקה. |
outcome |
פלט בלבד. התוצאה של הציפייה. |
semanticSimilarityResult |
פלט בלבד. התוצאה של בדיקת הדמיון הסמנטי. |
toolInvocationResult |
פלט בלבד. התוצאה של בדיקת ההפעלה של הכלי. |
שדה איחוד result. התוצאה של הציפייה. הערך result יכול להיות רק אחד מהבאים: |
|
observedToolCall |
פלט בלבד. התוצאה של הציפייה לקריאה לכלי. |
observedToolResponse |
פלט בלבד. התוצאה של הציפייה לתגובה מהכלי. |
observedAgentResponse |
פלט בלבד. התוצאה של הציפייה לתגובה מהסוכן. |
observedAgentTransfer |
פלט בלבד. התוצאה של ההעברה הצפויה לנציג. |
observedPayload |
פלט בלבד. מטען ייעודי (payload) מותאם אישית שנצפה. אין ציפיות לגבי מטען ייעודי (payload) בהתאמה אישית. הערך הזה משמש רק לחישוב מדדים. התוצאה תמיד תהיה SKIPPED. |
SemanticSimilarityResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, "outcome": enum ( |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 4: עקבי לחלוטין ציון 3: עקבי ברובו ציון 2: עקבי באופן חלקי (השמטות קלות) ציון 1: לא עקבי במידה רבה (השמטות משמעותיות) ציון 0: לא עקבי לחלוטין / סותר |
explanation |
פלט בלבד. ההסבר לציון הדמיון הסמנטי. |
outcome |
פלט בלבד. התוצאה של בדיקת הדמיון הסמנטי. הוא נקבע על ידי השוואת הציון לערך של semantic_similarity_success_threshold. אם הניקוד שווה לסף או גבוה ממנו, התוצאה תהיה PASS. אחרת, התוצאה תהיה FAIL. |
שדה איחוד הערך |
|
score |
פלט בלבד. ציון הדמיון הסמנטי. יכול להיות 0, 1, 2, 3 או 4. |
ToolInvocationResult
| ייצוג JSON |
|---|
{ "outcome": enum ( |
| שדות | |
|---|---|
outcome |
פלט בלבד. התוצאה של בדיקת ההפעלה של הכלי. ההחלטה מתקבלת על סמך השוואה בין הציון parameter_correctness_score לבין ערך הסף. אם הניקוד שווה לסף או גבוה ממנו, התוצאה תהיה PASS. אחרת, התוצאה תהיה FAIL. |
explanation |
פלט בלבד. הסבר בטקסט חופשי לתוצאה של הפעלת הכלי. |
שדה איחוד הערך |
|
parameterCorrectnessScore |
פלט בלבד. ציון הדיוק של פרמטר ההפעלה של הכלי. הערך הזה מציין את אחוז הפרמטרים מתוך קריאת הכלי הצפויה שהיו גם בקריאת הכלי בפועל. |
HallucinationResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 1: מוצדק ציון 0: לא מוצדק ציון -1: אין טענה להערכה |
explanation |
פלט בלבד. ההסבר לציון ההזיה. |
שדה איחוד הערך |
|
score |
פלט בלבד. ציון ההזיות. יכול להיות -1, 0, 1. |
ToolCallLatency
| ייצוג JSON |
|---|
{ "tool": string, "displayName": string, "startTime": string, "endTime": string, "executionLatency": string } |
| שדות | |
|---|---|
tool |
פלט בלבד. שם הכלי שהופעל. פורמט: |
displayName |
פלט בלבד. השם המוצג של הכלי. |
startTime |
פלט בלבד. שעת ההתחלה של הרצת הכלי. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
endTime |
פלט בלבד. שעת הסיום של ההרצה של קריאת הכלי. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
executionLatency |
פלט בלבד. זמן האחזור של הפעלת הכלי. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
OverallToolInvocationResult
| ייצוג JSON |
|---|
{ "outcome": enum ( |
| שדות | |
|---|---|
outcome |
פלט בלבד. התוצאה של בדיקת ההפעלה של הכלי. ההחלטה מתקבלת על ידי השוואה בין הציון tool_invocation_score לבין סף הדיוק הכולל של הפעלת הכלי overall_tool_invocation_correctness_threshold. אם הניקוד שווה לסף או גבוה ממנו, התוצאה תהיה PASS. אחרת, התוצאה תהיה FAIL. |
שדה איחוד הערך |
|
toolInvocationScore |
הציון הכולל של הפעלת הכלי בתור הזה. המדד הזה מציין את האחוז הכולל של הכלים מהתור הצפוי שהופעלו בפועל. |
EvaluationErrorInfo
| ייצוג JSON |
|---|
{
"errorType": enum ( |
| שדות | |
|---|---|
errorType |
פלט בלבד. סוג השגיאה. |
errorMessage |
פלט בלבד. הודעת השגיאה. |
sessionId |
פלט בלבד. מזהה הסשן של השיחה שגרמה לשגיאה. |
userFacingErrorMessage |
פלט בלבד. הודעת השגיאה שמוצגת למשתמש. |
SpanLatency
| ייצוג JSON |
|---|
{ "type": enum ( |
| שדות | |
|---|---|
type |
פלט בלבד. סוג הטווח. |
displayName |
פלט בלבד. השם המוצג של הטווח. רלוונטי לכלים ולגבולות שמוגדרים בטווחים. |
startTime |
פלט בלבד. שעת ההתחלה של הטווח. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
endTime |
פלט בלבד. שעת הסיום של טווח הזמן. הפלט שנוצר תמיד יהיה בפורמט RFC 3339, עם נורמליזציה של Z ושימוש ב-0, 3, 6 או 9 ספרות אחרי הנקודה. אפשר להשתמש גם בהיסטים אחרים, לא רק ב-Z. דוגמאות: |
executionLatency |
פלט בלבד. זמן האחזור של הטווח. משך זמן בשניות עם עד תשע ספרות אחרי הנקודה העשרונית, שמסתיים ב- |
שדה איחוד identifier. המזהה של הפריט הספציפי על סמך הסוג שלו. הערך identifier יכול להיות רק אחד מהבאים: |
|
resource |
פלט בלבד. שם המשאב של אמצעי הבקרה או של הכלים. |
toolset |
פלט בלבד. מזהה הכלי בערכת הכלים. |
model |
פלט בלבד. השם של טווח ה-LLM. |
callback |
פלט בלבד. השם של טווח הקריאה החוזרת של המשתמש. |
EvaluationExpectationResult
| ייצוג JSON |
|---|
{
"evaluationExpectation": string,
"prompt": string,
"outcome": enum ( |
| שדות | |
|---|---|
evaluationExpectation |
פלט בלבד. הציפייה מההערכה. פורמט: |
prompt |
פלט בלבד. ההנחיה שבה נעשה שימוש לצורך ההערכה. |
outcome |
פלט בלבד. התוצאה של ציפיית ההערכה. |
explanation |
פלט בלבד. ההסבר לתוצאה. |
ScenarioResult
| ייצוג JSON |
|---|
{ "conversation": string, "task": string, "userFacts": [ { object ( |
| שדות | |
|---|---|
conversation |
פלט בלבד. השיחה שנוצרה בתרחיש. |
task |
פלט בלבד. המשימה ששימשה להרצת התרחיש לתוצאה הזו. |
userFacts[] |
פלט בלבד. הנתונים על המשתמש ששימשו את התרחיש לחישוב התוצאה הזו. |
expectationOutcomes[] |
פלט בלבד. התוצאה של כל ציפייה. |
rubricOutcomes[] |
פלט בלבד. התוצאה של קריטריון ההערכה. |
hallucinationResult[] |
פלט בלבד. התוצאה של בדיקת ההזיות. תהיה תוצאת הזיה אחת לכל תור בשיחה. |
taskCompletionResult |
פלט בלבד. התוצאה של בדיקת השלמת המשימה. |
toolCallLatencies[] |
פלט בלבד. ההשהיה של כל הפעלה של קריאה לכלי בשיחה. |
userGoalSatisfactionResult |
פלט בלבד. התוצאה של בדיקת שביעות הרצון של המשתמש מהשגת המטרה. |
spanLatencies[] |
פלט בלבד. ההשהיה של טווחי הזמן בשיחה. |
evaluationExpectationResults[] |
פלט בלבד. תוצאות הציפיות מההערכה. |
שדה איחוד הערך |
|
allExpectationsSatisfied |
פלט בלבד. האם כל הציפיות התממשו בתור הזה. |
שדה איחוד הערך |
|
taskCompleted |
פלט בלבד. האם המשימה הושלמה בתור הזה. התשובה מורכבת מכל הציפיות שהתממשו, ללא הזיות, וממידת שביעות הרצון של המשתמש מהשגת היעד. |
ScenarioExpectationOutcome
| ייצוג JSON |
|---|
{ "expectation": { object ( |
| שדות | |
|---|---|
expectation |
פלט בלבד. הציפייה שנבדקה. |
outcome |
פלט בלבד. התוצאה של ScenarioExpectation. |
שדה איחוד result. התוצאה של הציפייה. הערך result יכול להיות רק אחד מהבאים: |
|
observedToolCall |
פלט בלבד. הקריאה לכלי שנצפתה. |
observedAgentResponse |
פלט בלבד. התשובה שנצפתה מהסוכן. |
ObservedToolCall
| ייצוג JSON |
|---|
{ "toolCall": { object ( |
| שדות | |
|---|---|
toolCall |
פלט בלבד. הקריאה לכלי שנצפתה. |
toolResponse |
פלט בלבד. התשובה שנצפתה מהכלי. |
ScenarioRubricOutcome
| ייצוג JSON |
|---|
{ "rubric": string, "scoreExplanation": string, // Union field |
| שדות | |
|---|---|
rubric |
פלט בלבד. קריטריון ההערכה ששימש להערכת השיחה. |
scoreExplanation |
פלט בלבד. התשובה של המעריך לקריטריון ההערכה. |
שדה איחוד הערך |
|
score |
פלט בלבד. הציון של השיחה בהשוואה לקריטריון ההערכה. |
TaskCompletionResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 1: ציון על השלמת משימה ציון 0: ציון על אי-השלמת משימה ציון -1: יעד המשתמש לא הוגדר |
explanation |
פלט בלבד. הסבר על ציון השלמת המשימה. |
שדה איחוד הערך |
|
score |
פלט בלבד. הציון על השלמת המשימה. יכול להיות -1, 0, 1 |
UserGoalSatisfactionResult
| ייצוג JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| שדות | |
|---|---|
label |
פלט בלבד. התווית שמשויכת לכל ציון. ציון 2: ציון העברה חלקה ציון 1: ציון שביעות רצון של המשתמש מהמשימה ציון 0: ציון חוסר שביעות רצון של המשתמש מהמשימה ציון -1: ציון לא מוגדר של שביעות רצון של המשתמש מהמשימה |
explanation |
פלט בלבד. הסבר לציון שביעות הרצון של המשתמש מהמשימה. |
שדה איחוד הערך |
|
score |
פלט בלבד. ציון שביעות הרצון של המשתמש מהמשימה. יכול להיות -1, 0, 1, 2. |
EvaluationPersona
| ייצוג JSON |
|---|
{
"name": string,
"description": string,
"displayName": string,
"personality": string,
"speechConfig": {
object ( |
| שדות | |
|---|---|
name |
חובה. המזהה הייחודי של האישיות. פורמט: |
description |
זה שינוי אופציונלי. תיאור של האישיות. |
displayName |
חובה. השם המוצג של האישיות. ייחודי בתוך אפליקציה. |
personality |
חובה. הוראה לסוכן לגבי אופן ההתנהגות בתהליך ההערכה. |
speechConfig |
זה שינוי אופציונלי. הגדרות של איך האישיות נשמעת (הגדרות TTS). |
SpeechConfig
| ייצוג JSON |
|---|
{
"speakingRate": number,
"environment": enum ( |
| שדות | |
|---|---|
speakingRate |
זה שינוי אופציונלי. קצב הדיבור. 1.0 הוא ערך רגיל. ערך נמוך יותר מייצג קצב איטי יותר (למשל, 0.8), וערך גבוה יותר מייצג קצב מהיר יותר (למשל, 1.5). הבדיקה הזו שימושית כדי לראות איך הסוכן מתמודד עם אנשים שמדברים מהר. |
environment |
זה שינוי אופציונלי. סביבת האודיו המדומה. |
voiceId |
זה שינוי אופציונלי. המזהה הספציפי של הקול או המבטא שבו רוצים להשתמש. דוגמה: en-US-Wavenet-D או en-GB-Standard-A |
סטטוס
| ייצוג JSON |
|---|
{ "code": integer, "message": string, "details": [ { "@type": string, field1: ..., ... } ] } |
| שדות | |
|---|---|
code |
קוד הסטטוס, שצריך להיות ערך enum של |
message |
הודעת שגיאה שמוצגת למפתחים, שצריכה להיות באנגלית. כל הודעת שגיאה שמוצגת למשתמש צריכה להיות מותאמת לשפה המקומית ולהישלח בשדה |
details[] |
רשימה של הודעות שכוללות את פרטי השגיאה. יש קבוצה משותפת של סוגי הודעות לשימוש בממשקי API. אובייקט שמכיל שדות מסוג שרירותי. שדה נוסף |
הכול
| ייצוג JSON |
|---|
{ "typeUrl": string, "value": string } |
| שדות | |
|---|---|
typeUrl |
מזהה את הסוג של הודעת Protobuf שעברה סריאליזציה באמצעות הפניה ל-URI שכוללת קידומת שמסתיימת בקו נטוי ואת שם הסוג שמוגדר במלואו. דוגמה: type.googleapis.com/google.protobuf.StringValue המחרוזת הזו צריכה להכיל לפחות תו אחד של הקידומת היא שרירותית, וההטמעות של Protobuf אמורות פשוט להסיר את כל מה שמופיע עד הסימן כל מחרוזות כתובות ה-URL של הסוג חייבות להיות הפניות חוקיות ל-URI, עם הגבלה נוספת (בפורמט הטקסט) שלפיה התוכן של ההפניה חייב לכלול רק תווים אלפאנומריים, תווים מיוחדים עם קידוד אחוזים ותווים מהקבוצה הבאה (לא כולל הגרשיים החיצוניים): בתכנון המקורי של |
value |
מכיל סריאליזציה של Protobuf של הסוג שמתואר על ידי type_url. מחרוזת בקידוד Base64. |
EvaluationMetricsThresholds
| ייצוג JSON |
|---|
{ "goldenEvaluationMetricsThresholds": { object ( |
| שדות | |
|---|---|
goldenEvaluationMetricsThresholds |
זה שינוי אופציונלי. ערכי הסף של מדדי ההערכה המושלמים. |
hallucinationMetricBehavior |
זה שינוי אופציונלי. הוצא משימוש: במקומו, צריך להשתמש ב- |
goldenHallucinationMetricBehavior |
זה שינוי אופציונלי. התנהגות מדד ההזיות בהערכות מוזהבות. |
scenarioHallucinationMetricBehavior |
זה שינוי אופציונלי. התנהגות מדד ההזיות בהערכות של תרחישים. |
GoldenEvaluationMetricsThresholds
| ייצוג JSON |
|---|
{ "turnLevelMetricsThresholds": { object ( |
| שדות | |
|---|---|
turnLevelMetricsThresholds |
זה שינוי אופציונלי. ערכי הסף של המדדים ברמת התור. |
expectationLevelMetricsThresholds |
זה שינוי אופציונלי. ערכי הסף של מדדי רמת הציפייה. |
toolMatchingSettings |
זה שינוי אופציונלי. הגדרות ההתאמה של הכלי. קריאה נוספת לכלי היא קריאה לכלי שקיימת בהרצה אבל לא תואמת לאף קריאה לכלי בציפייה המוזהבת. |
ToolMatchingSettings
| ייצוג JSON |
|---|
{
"extraToolCallBehavior": enum ( |
| שדות | |
|---|---|
extraToolCallBehavior |
זה שינוי אופציונלי. התנהגות במקרה של קריאות נוספות לכלים. ברירת המחדל היא FAIL. |
EvaluationConfig
| ייצוג JSON |
|---|
{ "inputAudioConfig": { object ( |
| שדות | |
|---|---|
inputAudioConfig |
זה שינוי אופציונלי. הגדרות לעיבוד האודיו שמתקבל מהמיקרופון. |
outputAudioConfig |
זה שינוי אופציונלי. הגדרות ליצירת פלט האודיו. |
evaluationChannel |
זה שינוי אופציונלי. הערוץ שרוצים להעריך. |
toolCallBehaviour |
זה שינוי אופציונלי. קובע אם ההערכה צריכה להשתמש בקריאות אמיתיות לכלים או בכלים מזויפים. |
InputAudioConfig
| ייצוג JSON |
|---|
{
"audioEncoding": enum ( |
| שדות | |
|---|---|
audioEncoding |
חובה. הקידוד של נתוני האודיו של הקלט. |
sampleRateHertz |
חובה. תדירות הדגימה (בהרץ) של נתוני האודיו של הקלט. |
noiseSuppressionLevel |
זה שינוי אופציונלי. האם להפעיל סינון רעשים באודיו של הקלט. הערכים האפשריים הם low, moderate, high, very_high. |
OutputAudioConfig
| ייצוג JSON |
|---|
{
"audioEncoding": enum ( |
| שדות | |
|---|---|
audioEncoding |
חובה. הקידוד של נתוני האודיו של הפלט. |
sampleRateHertz |
חובה. תדירות הדגימה (בהרץ) של נתוני האודיו של הפלט. |
EvaluationMetricsConfig
| ייצוג JSON |
|---|
{ "goldenMetricsConfig": { object ( |
| שדות | |
|---|---|
goldenMetricsConfig |
זה שינוי אופציונלי. הגדרות של המדדים המרכזיים להערכה. |
scenarioMetricsConfig |
זה שינוי אופציונלי. הגדרות מדדי התרחיש להערכה. |
GoldenMetricsConfig
| ייצוג JSON |
|---|
{ "semanticSimilarityMetricsConfig": { object ( |
| שדות | |
|---|---|
semanticSimilarityMetricsConfig |
זה שינוי אופציונלי. הגדרה גלובלית של מדדים של דמיון סמנטי. |
toolCorrectnessMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדי דיוק של כלי ברמת התור. |
stepToolCorrectnessMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדי דיוק של כלי ברמת השלב. |
ToolCorrectnessMetricsConfig
| ייצוג JSON |
|---|
{ "enableToolCorrectnessMetrics": boolean } |
| שדות | |
|---|---|
enableToolCorrectnessMetrics |
זה שינוי אופציונלי. האם לחשב מדדי נכונות של הכלי לצורך ההערכה. |
ScenarioMetricsConfig
| ייצוג JSON |
|---|
{ "userGoalMetMetricsConfig": { object ( |
| שדות | |
|---|---|
userGoalMetMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדים של השגת יעדים עסקיים ברמת המשתמש. |
expectationsMetMetricsConfig |
זה שינוי אופציונלי. הגדרות למדדים של רמת הציפיות. |
UserGoalMetMetricsConfig
| ייצוג JSON |
|---|
{ "enableUserGoalMetMetrics": boolean } |
| שדות | |
|---|---|
enableUserGoalMetMetrics |
זה שינוי אופציונלי. האם לחשב את מדדי היעד שהמשתמש השיג לצורך ההערכה. |
ExpectationsMetMetricsConfig
| ייצוג JSON |
|---|
{ "enableExpectationsMetMetrics": boolean } |
| שדות | |
|---|---|
enableExpectationsMetMetrics |
זה שינוי אופציונלי. האם לחשב את מדדי רמת הציפיות להערכה. |
NullValue
מייצג JSON null.
NullValue הוא ערך שמירה, שמשתמש בערך מספרי עם ערך אחד בלבד כדי לייצג את ערך ה-null עבור איחוד הסוגים Value.
שדה מסוג NullValue עם ערך כלשהו שאינו 0 נחשב לא תקין. רוב כלי הסריאליזציה של ProtoJSON יפלטו Value עם null_value שמוגדר כ-null JSON בלי קשר לערך המספרי, ולכן יבצעו המרה הלוך ושוב לערך 0.
| טיפוסים בני מנייה (enum) | |
|---|---|
NULL_VALUE |
ערך null. |
ComparisonType
סוגי ההשוואה הנתמכים לבדיקת התשובה של הסוכן.
| טיפוסים בני מנייה (enum) | |
|---|---|
COMPARISON_TYPE_UNSPECIFIED |
סוג השוואה לא צוין. ההתנהגות מוגדרת כברירת מחדל ל-SEMANTIC_SIMILARITY לתגובות של סוכנים ולקריאות כלים. |
EQUALS |
התאמה מדויקת של מחרוזת. |
CONTAINS |
התאמה של מחרוזת משנה (בודקת אם המחרוזת הצפויה כלולה בתשובה בפועל). |
SEMANTIC_SIMILARITY |
התאמה של דמיון סמנטי (הערכת דמיון במשמעות באמצעות LLM). |
SemanticSimilarityChannel
הערוץ שבו רוצים להשתמש לדמיון סמנטי.
| טיפוסים בני מנייה (enum) | |
|---|---|
SEMANTIC_SIMILARITY_CHANNEL_UNSPECIFIED |
לא צוין מדד. ברירת המחדל היא TEXT. |
TEXT |
שימוש בדמיון סמנטי בין טקסטים. |
AUDIO |
שימוש בדמיון סמנטי של אודיו. |
HallucinationMetricBehavior
ההתנהגות של מדד ההזיות. ללא קשר להתנהגות, המדד תמיד יחושב. ההבדל הוא שכשהמדד מושבת, הוא לא משמש לחישוב הציון הכולל של ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
HALLUCINATION_METRIC_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת של מדד הזיות. |
DISABLED |
השבתה של מדד ההזיות. |
ENABLED |
הפעלת מדד ההזיות. |
TaskCompletionBehavior
ההתנהגות הצפויה של משימת המשתמש. המידע הזה משמש כדי לקבוע אם התרחיש הצליח.
| טיפוסים בני מנייה (enum) | |
|---|---|
TASK_COMPLETION_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת. ברירת המחדל היא TASK_SATISFIED. |
TASK_SATISFIED |
משימת המשתמש צריכה להסתיים בהצלחה. |
TASK_REJECTED |
צריך לדחות את משימת המשתמש. |
UserGoalBehavior
ההתנהגות הצפויה של המשתמש ביחס ליעד. המידע הזה משמש כדי לקבוע אם התרחיש הצליח.
| טיפוסים בני מנייה (enum) | |
|---|---|
USER_GOAL_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת. ברירת המחדל היא USER_GOAL_SATISFIED. |
USER_GOAL_SATISFIED |
המטרה של המשתמש צריכה להסתיים בהצלחה. |
USER_GOAL_REJECTED |
צריך לדחות את יעד המשתמש. |
USER_GOAL_IGNORED |
מתעלמים מהסטטוס של היעד של המשתמש. |
ScenarioExecutionMode
מצב ההרצה של הערכות התרחישים.
| טיפוסים בני מנייה (enum) | |
|---|---|
SCENARIO_EXECUTION_MODE_UNSPECIFIED |
מצב ביצוע לא מוגדר. ברירת המחדל היא QUALITY_OPTIMIZED. |
QUALITY_OPTIMIZED |
מצב אופטימיזציה לאיכות. |
SPEED_OPTIMIZED |
מצב אופטימיזציה למהירות. |
תוצאת הסריקה
התוצאה של הבדיקה או הציפייה.
| טיפוסים בני מנייה (enum) | |
|---|---|
OUTCOME_UNSPECIFIED |
תוצאת ההערכה לא צוינה. |
PASS |
ההערכה או הציפייה עברו. במקרה של הערכה, המשמעות היא שכל הציפיות התממשו. |
FAIL |
ההערכה או הציפייה נכשלו. במקרה של הערכה, המשמעות היא שלפחות ציפייה אחת לא התממשה. |
SKIPPED |
דילוג על הערכה/ציפייה. |
ErrorType
סוג השגיאה
| טיפוסים בני מנייה (enum) | |
|---|---|
ERROR_TYPE_UNSPECIFIED |
סוג שגיאה לא מזוהה. |
RUNTIME_FAILURE |
הייתה שגיאה במהלך ההרצה. |
CONVERSATION_RETRIEVAL_FAILURE |
הייתה בעיה והשיחה לא אוחזרה מ-CES Runtime. |
METRIC_CALCULATION_FAILURE |
לא הצלחנו לחשב מדד או תוצאה. |
EVALUATION_UPDATE_FAILURE |
עדכון ההערכה נכשל. |
QUOTA_EXHAUSTED |
הגעתם למכסה. |
USER_SIMULATION_FAILURE |
הייתה שגיאה במהלך סימולציית המשתמשים. |
סוג
סוג הטווח. יכול להיות שבעתיד נוסיף עוד ערכים.
| טיפוסים בני מנייה (enum) | |
|---|---|
TYPE_UNSPECIFIED |
ערך ברירת המחדל. הערך הזה לא בשימוש. |
TOOL |
טווח של קריאה לכלי. |
USER_CALLBACK |
משך הזמן של שיחת משתמש חוזרת. |
GUARDRAIL |
טווח שכבות ההגנה. |
LLM |
טווח LLM. |
BackgroundEnvironment
סביבת אודיו מדומה.
| טיפוסים בני מנייה (enum) | |
|---|---|
BACKGROUND_ENVIRONMENT_UNSPECIFIED |
לא צוינה סביבת רקע. |
CALL_CENTER |
סביבת מוקד טלפוני. |
TRAFFIC |
סביבה עם רעשי תנועה. |
KIDS_NOISE |
סביבה רועשת של ילדים. |
CAFE |
סביבת בית קפה. |
ExecutionState
המצב של ביצוע תוצאת ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
EXECUTION_STATE_UNSPECIFIED |
לא צוין מצב הביצוע של תוצאת ההערכה. |
QUEUED |
ההפעלה של תוצאת ההערכה ממתינה בתור. |
RUNNING |
ההרצה של תוצאת ההערכה מתבצעת. |
COMPLETED |
ההרצה של תוצאת ההערכה הסתיימה. |
ERROR |
הביצוע של תוצאת ההערכה נכשל בגלל שגיאה פנימית. |
CANCELLED |
ההרצה של תוצאת ההערכה בוטלה. |
ExtraToolCallBehavior
ההגדרה הזו מגדירה את ההתנהגות כשנתקלים בקריאה נוספת לכלי. קריאה נוספת לכלי היא קריאה לכלי שקיימת בהרצה אבל לא תואמת לאף קריאה לכלי בציפייה המוזהבת.
| טיפוסים בני מנייה (enum) | |
|---|---|
EXTRA_TOOL_CALL_BEHAVIOR_UNSPECIFIED |
התנהגות לא מוגדרת. ברירת המחדל היא FAIL. |
FAIL |
הבדיקה תיכשל אם יזוהה קריאה נוספת לכלי. |
ALLOW |
מאשרים את השימוש בכלי הנוסף. |
AudioEncoding
המאפיין AudioEncoding מציין את פורמט הקידוד של נתוני האודיו.
| טיפוסים בני מנייה (enum) | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
קידוד אודיו שלא צוין. |
LINEAR16 |
קידוד אודיו PCM ליניארי של 16 ביט. |
MULAW |
דגימות של 8 ביט שמרחיבות דגימות אודיו של 14 ביט באמצעות G.711 PCMU/mu-law. |
ALAW |
דגימות של 8 ביט שמרחיבות דגימות אודיו של 14 ביט באמצעות G.711 PCMU/A-law. |
EvaluationChannel
הערוץ שרוצים להעריך.
| טיפוסים בני מנייה (enum) | |
|---|---|
EVALUATION_CHANNEL_UNSPECIFIED |
ערוץ הערכה לא מוגדר. |
TEXT |
ערוץ הערכה מסוג טקסט בלבד. |
AUDIO |
ערוץ להערכת אודיו. |
EvaluationToolCallBehaviour
הגדרת אופן הפעולה של קריאות לכלי בהרצות של הערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
EVALUATION_TOOL_CALL_BEHAVIOUR_UNSPECIFIED |
התנהגות לא מוגדרת של קריאה לכלי. ברירת המחדל היא שימוש בקריאות אמיתיות לכלי. |
REAL |
שימוש בקריאות אמיתיות לכלי. |
FAKE |
שימוש בקריאות מזויפות לכלים. |
GoldenRunMethod
השיטה שבה נעשה שימוש להפעלת ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
GOLDEN_RUN_METHOD_UNSPECIFIED |
לא צוינה שיטת ההפעלה. |
STABLE |
מריצים את ההערכה כהפעלה חוזרת יציבה, שבה כל תור הוא סשן ייחודי עם התורות הקודמות הצפויות שמוזרקות כהקשר. |
NAIVE |
מריצים את ההערכה כהפעלה חוזרת פשוטה, שבה ההפעלה היא סשן יחיד ללא הקשר מוזרק. |
OutcomeMetadata
מטא-נתונים לגבי תוצאת ההערכה.
| טיפוסים בני מנייה (enum) | |
|---|---|
OUTCOME_METADATA_UNSPECIFIED |
מטא-נתונים לא מוגדרים של התוצאה. |
GRACEFUL_HANDOFF |
ההערכה הובילה להעברה חלקה לנציג אנושי. |
הערות על כלים
הערות על כלים נשלחות ללקוחות MCP כדי לתאר את הסיכון הבסיסי של כלי מסוים. רוב הלקוחות מתייחסים לרמזים האלה כאל רמזים לא מהימנים, אבל אפשר להשתמש בהם כדי להחליט מתי לשלוח למשתמש בקשת אישור.
בנוסף למחרוזת הכותרת, מוגדרים הרמזים הבוליאניים הבאים:
-
readOnlyHint: אם הערך הוא true, הכלי לא משנה את הסביבה שלו. ברירת מחדל: false. -
destructiveHint: אם הערך הוא True, הכלי יכול לבצע פעולות הרסניות. אם הערך הוא false, הכלי יכול לבצע רק פעולות של הוספה. ברירת מחדל: true. -
idempotentHint: אם הערך הוא True, קריאה חוזרת לכלי עם אותם ארגומנטים לא תשפיע על הסביבה שלו. ברירת מחדל: false. -
openWorldHint: אם הערך הוא True, הכלי יכול ליצור אינטראקציה עם 'עולם פתוח' של ישויות חיצוניות. אם הערך הוא false, הכלי יכול ליצור אינטראקציה רק עם ישויות פנימיות. לדוגמה, כלי לחיפוש באינטרנט יהיה עולם פתוח, אבל כלי לזיכרון לא יהיה עולם פתוח.
רמז הרסני: ❌ | רמז אידמפוטנטי: ❌ | רמז לקריאה בלבד: ❌ | רמז לעולם פתוח: ❌