הערכה היא כלי חשוב לבדיקת הביצועים של הסוכן ולווידוא שהוא מתנהג כמו שצריך במצבים ספציפיים. הכלי מאפשר לכם להפוך את הבדיקות לאוטומטיות, לזהות רגרסיות אחרי ביצוע שינויים ולמדוד את איכות התשובות של הסוכן כדי לשפר את האיכות שלו.
כדי להתחיל, לוחצים על הלחצן הערכה בחלק העליון של הכלי ליצירת סוכנים.
מושגים שקשורים להערכה
מקרה בדיקה: כל מקרה בדיקה הוא תרחיש בדיקה ספציפי ועצמאי או הנחיה שנועדו להעריך את הביצועים של הסוכן. אפשר ליצור שני סוגים שונים של תרחישי בדיקה:
- תרחיש: תכונה מבוססת-AI שמאפשרת להפעיל את הבדיקות ולוודא כיסוי בדיקות מקיף. אתם מתארים מטרה של משתמש, והמערכת מדמה את המשתמש באופן אוטומטי ויוצרת שיחות כדי לבדוק את היכולת של הסוכן להתמודד עם התרחיש בצורה חזקה. תרחישים הם דרך שימושית להתנסות ולעזור להגדיר שיחות מוצלחות.
- Golden: מתאים לבדיקות רגרסיה. אתם מספקים נתיב שיחה ספציפי ו"אידיאלי", וההערכה בודקת אם ההתנהגות של הנציג תואמת לנתיב האידיאלי הזה, כולל קריאות לכלים.
הרצה: הרצת הערכה מייצגת ביצוע מלא של קבוצה של תרחישי בדיקה ושל תרחישי בדיקה מוזהבים, בהשוואה לביצועים של הסוכן שנבדק. כל הרצה יכולה לכלול מקרה בדיקה אחד או יותר.
תוצאה: תוצאה של תרחיש בדיקה מתייחסת להרצה יחידה של תרחיש בדיקה ספציפי בהרצה אחת. אם מריצים תרחיש בדיקה כמה פעמים במהלך הפעלה אחת של הערכה (למשל, כדי לבדוק עקביות, חוסר יציבות וכו'), כל הרצה בנפרד היא תוצאה נפרדת. התוצאות מוצגות כסמלים מלבניים בעמודות בכל שורה של תרחיש בדיקה. אם ההרצה נכשלה, מוצג X אדום, ואם היא עברה, מוצג סימן וי ירוק.
תגים: אפשר לקבץ תרחישי בדיקה באמצעות תגים כדי לנהל אותם בקלות רבה יותר.
יצירת מקרי בדיקה
כדי ליצור תרחישי בדיקה לסוכן ולגשת אליהם, לוחצים על הלחצן הערכה בחלק העליון של הכלי לבניית סוכנים. אתם יכולים ליצור ולנהל תרחישי בדיקה מוזהבים או מבוססי תרחיש.
תרחיש
מקרה בדיקה מבוסס-תרחיש משתמש ב-AI כדי ליצור באופן אוטומטי מגוון שיחות על סמך יעד כללי של משתמש שאתם מגדירים. במקום לספק שיחות ספציפיות לדוגמה, אתם בוחרים תרחישים שנוצרו או מתארים תרחישים ספציפיים שצריך לבדוק. זהו כלי רב עוצמה שיעזור לכם לבחון מקרים חריגים ולבדוק את החוסן של הסוכן, בלי שתצטרכו לכתוב ידנית כל נתיב שיחה אפשרי.
אחרי שתהיו מרוצים מהתרחישים האלה, תוכלו לשמור אותם כשיחות לדוגמה.
כדי ליצור תרחיש:
- לוחצים על יצירת תרחיש. מוצעים לכם כמה תרחישים.
- אפשר ליצור תרחישים על סמך הבחירות או ליצור תרחיש חדש מאפס.
כשמציגים את רשימת התרחישים, אפשר ללחוץ על תרחיש כדי לראות את הפרטים שלו ואת רשימת השיחות.
כדי לשמור תרחיש כשיחה מוזהבת:
- בוחרים את התרחיש.
- לוחצים על לחצן התפריט בפינה השמאלית העליונה.
- לוחצים על שמירה כשיחה לדוגמה.
יעד משתמש בתרחיש
לכל תרחיש יש מטרה של המשתמש, שמתארת את המטרות של משתמש הקצה כשהוא משתמש באפליקציית הסוכן. לדוגמה:
Securely book a specific room at a chosen hotel and receive a confirmation.
בהתאם ליעד המשתמש, CX Agent Studio יוצר באופן אוטומטי שיחות שמשמשות להערכה.
משתני תרחיש
כשמגדירים תרחיש, אפשר לספק משתנים שבהם צריך להשתמש בתרחיש.
ציפיות לגבי התרחיש
כדי לבצע הערכה, צריך להגדיר ציפיות לתרחיש הבדיקה.
יש שני סוגים של ציפיות:
- הודעה: תשובה צפויה מנציג.
- קריאה לכלי: קריאה לכלי עם קלט ופלט צפויים.
התנאים של הציפיות יכולים להיות:
- חובה
- אסור להשתמש
- אחרי קריאה לכלי
- ערך משתנה
כדי ליצור ציפייה:
- כדי לפתוח את הפרטים של תרחיש מסוים, לוחצים עליו.
- בקטע ציפיות, לוחצים על הצגת הכול.
- פועלים לפי ההוראות בממשק כדי ליצור ציפיות לגבי התרחיש.
זהוב
תרחישי הבדיקה האלה משמשים להגדרת נתיבי שיחה אידיאליים לבדיקת רגרסיה, כדי שנתיבי שיחה מרכזיים וקריטיים לא ייפגעו כשמעדכנים את הסוכן. יש כמה אפשרויות ליצירת שיחה מושלמת:
כדי לייבא שיחה מהסימולטור:
- להתחיל שיחה באמצעות הסימולטור.
- לוחצים על סמל האפשרויות הנוספות (3 נקודות אנכיות) בפינה השמאלית העליונה של הסימולטור כדי לפתוח את תפריט הסימולטור.
- לוחצים על שמירה כגרסת הזהב.
- מזינים שם לתרחיש הבדיקה המושלם ולוחצים על שמירה. הוא יופיע עכשיו בכרטיסייה הערכה.
כדי ליצור תרחיש בדיקה מהיסטוריית השיחות:
- עוברים לכרטיסייה Evaluation (הערכה).
- לוחצים על + הוספת תרחיש בדיקה.
- בוחרים באפשרות מוזהב.
- לוחצים על הבא.
- לוחצים על בחירה מתוך היסטוריית השיחות.
- בחלון שמופיע, בוחרים את השיחה שרוצים לשמור כתרחיש בדיקה לדוגמה. אפשר לחפש לפי מזהה השיחה.
- אם הפעלתם את ההסתרה, כדאי לבדוק את התשובות של הנציגים ואת המשתנים לפני שממשיכים עם מידע חסר.
- לוחצים על הוספה.
כדי ליצור תרחיש בדיקה מאפס:
- עוברים לכרטיסייה Evaluation (הערכה).
- לוחצים על + הוספת תרחיש בדיקה.
- בוחרים באפשרות מוזהב.
- לוחצים על הבא.
- לוחצים על יצירה מאפס.
- בחלון שמופיע, מוסיפים שם לתצוגה לתרחיש הבדיקה.
- מוסיפים טקסט לקלט של משתמשים ולציפיות מהסוכן לפי הצורך. לוחצים על + הוספת קלט של משתמשים ועל + הוספת ציפייה מהסוכן כדי להוסיף תגובות. לוחצים על + הוספת תור כדי להוסיף תור חדש של שיחה לתרחיש הבדיקה.
- לוחצים על יצירה כדי להוסיף את תרחיש הבדיקה המוזהב לרשימת תרחישי הבדיקה.
כדי ליצור תרחיש בדיקה משיחה מדומה בתרחיש בדיקה:
- עוברים לדף התוצאות של הרצת ההערכה.
- לוחצים על סמל התפריט (שלוש נקודות אנכיות) משמאל לשיחה שנבחרה ואז על שמירה כשיחה לדוגמה.
כדי להעלות קבוצה של תרחישי בדיקה מקובץ:
פרטים על פורמט הקובץ ותבנית CSV זמינים בדף פורמט CSV של תרחישי בדיקה מושלמים.
ציפיות מוזהבות
כדי לבצע הערכה, צריך להגדיר ציפיות לתרחיש הבדיקה המושלם. ציפייה היא תוצאה ספציפית שאתם מצפים לה מהנציג בנקודה מסוימת בשיחה. במהלך ההערכה, ההתנהגות בפועל של הנציג מושווית לציפיות האלה.
הציפיות יכולות להיות מהסוגים הבאים:
- הודעה: תשובה כתובה צפויה מהסוכן למשתמש הקצה. ההערכה בודקת אם התגובה של הסוכן תואמת מבחינה סמנטית לציפייה הזו.
- קריאה לכלי: ציפייה שהסוכן יקרא לכלי ספציפי ויגיב. אפשר גם לציין את ארגומנטי הקלט הצפויים לקריאה לכלי.
- העברה לסוכן: ציפייה שהסוכן יעביר את השיחה לסוכן אנושי או לבוט אחר.
כדי ליצור ציפייה:
- לוחצים על תרחיש בדיקה מוזהב ספציפי כדי לפתוח את הפרטים שלו.
- בקטע פרטים, לוחצים על הצגת כללי הזהב.
- פועלים לפי ההוראות בממשק כדי להוסיף ציפיות או לשנות אותן.
הגדרות ההערכה
בשורה של הכותרות ברשימת תרחישי הבדיקה, אפשר להגדיר את הגדרות ההערכה:
- Goldens:
- קריטריונים להצלחה או לכישלון של שיחה: הגדרת הלוגיקה שלפיה שיחה מדומה תוגדר כהצלחה או ככישלון.
- רמת התור:
הכללים האלה בודקים כל תור בנפרד.
אם אחד מהספים האלה לא מתקיים,
המדד הספציפי יסומן בצבע אדום ככישלון.
- דמיון סמנטי: ערך הסף לדמיון סמנטי.
- נכונות הכלי: ערך הסף לנכונות הכלי.
- הזיות: אם האפשרות הזו מושבתת, ההזיות לא נכללות בבדיקה.
- רמת הציפיות:
הכללים האלה בודקים את הציפיות במהלך תור.
אם אחד מהספים האלה לא מתקיים,
המדד הספציפי יסומן בצבע אדום ככישלון.
- נכונות הכלי: ערך הסף לנכונות הכלי.
- שיטת ההרצה המוזהבת: בוחרים בין אימות הפעלה חוזרת פשוט או יציב.
- Tool fake: שימוש בנתונים מדומה במקום בקריאות API אמיתיות של סביבת ייצור.
- Scenarios:
- קריטריונים להצלחה או לכישלון של תרחיש: הגדרת הלוגיקה לקביעה אם שיחה מדומה עוברת או נכשלת.
- יוזם השיחה: מגדירים מי מתחיל את השיחה, המשתמש או המודל.
- Tool fake: שימוש בנתונים מדומה במקום בקריאות API אמיתיות של סביבת ייצור.
- בדיקת אודיו
- הקלטות להערכת איכות האודיו
הרצת הערכות
כדי להריץ הערכה, אפשר ללחוץ על לחצן ההרצה בשורה של תרחיש הבדיקה, או לבחור כמה תרחישי בדיקה ולהריץ אותם.
אם שמרתם כמה גרסאות, תוכלו לבחור איזו גרסה של הסוכן תופעל, או לשמור אוטומטית את טיוטת הסוכן כגרסה חדשה להרצה.
אחרי הרצת הערכה, המדדים יעודכנו והתוצאות יוצגו.
אם לוחצים על הערכה מסוימת של הרצה, אפשר לראות את התוצאות המפורטות של ההרצה. בנוסף למדדים הרגילים, מוצגים המדדים הבאים:
- פניות שנכשלו
- רשימה עם מספור עמודים של כל פרטי התור, כולל תשובות סוכנים בפועל ותשובות סוכנים צפויות.
במקרים של בדיקות מוצלחות, יכול להיות שתראו את המונח 'הפעלה חוזרת יציבה'. המונח הזה מציין שהבדיקה בוצעה בסביבה עקבית (כלומר, בלי שינוי בהקשר או בקלט).
שימוש ב-AI לשיפור תרחישי בדיקה (תצוגה מקדימה)
אפשר גם להשתמש ב-AI כדי לפתור בעיות בהרצה ולהציע דרכים לשיפור האיכות של הסוכן. ההצעות של ה-AI הן אופטימליות כשיש 3 הרצות או יותר. כדי להפעיל את ה-AI, בוחרים את מקרי הבדיקה שרוצים להעריך ולוחצים על הפעלת הבדיקות שנבחרו. בחלון שמופיע, מסמנים את התיבה לצד איתור בעיות באמצעות AI.
אחרי שההרצה תסתיים, בדף התוצאות יוצגו הצעות מבוססות-AI.
Gemini יוצר באופן אוטומטי loss_report שאפשר להוריד, שמסכם היבטים של ביצועי הסוכן ומדגיש תחומים שאפשר לשפר.
כל משתמש יכול לראות את התיקונים שהוצעו על ידי AI, אבל רק מי שהפעיל את ההרצה יכול לבצע פעולות על סמך התוצאות.
לוחצים על יש לך שאלה ל-Gemini? כדי ליצור אינטראקציה עם סוכן העזרה. קודם מוצג דוח ההפסדים שבו מוסברות בעיות ברמה גבוהה במודל או בסוכן. אתם יכולים לבקש מהסוכן הווירטואלי להסביר את הדוח, והוא יסכם את הדוח ויציע תיקונים. אחרי שתבצעו את התיקונים, תוכלו לבקש מנציג התמיכה לבצע שוב את הבדיקה.
ייבוא וייצוא
אפשר לייבא ולייצא תרחישי בדיקה, הרצות ותוצאות של הערכות בפורמט YAML או JSON. כשמייבאים, חשוב לוודא שהסוכן המקבל מכיל את כל המשאבים (כלים, משתנים וסוכני משנה) שמוגדרים בנתונים המיוצאים.
כדי לייצא תרחישי בדיקה:
- בוחרים תרחיש בדיקה אחד או יותר.
- לוחצים על ייצוא תרחישי בדיקה.
- בחר פורמט.
- תתבצע הורדה של קובץ ZIP.
כדי לייבא מקרי בדיקה:
- לוחצים על + הוספת תרחיש בדיקה.
- בוחרים באפשרות מוזהב.
- לוחצים על הבא.
- מעלים את קובץ ה-ZIP.
- אם יש התנגשויות עם הייבוא, תקבלו הנחיות לפתרון שלהן.
- לוחצים על יצירה.
כדי לייצא את ההרצות והתוצאות של ההערכה:
- בוחרים הפעלה אחת או יותר של הערכה.
- לוחצים על ייצוא ההפעלה.
- בחר פורמט.
- תתבצע הורדה של קובץ ZIP.
מדדים
כל תוצאה של תרחיש בדיקה כוללת קבוצה של מדדים שמודדים את הביצועים של הסוכן ביחס לתרחישי הבדיקה שבחרתם. המדדים מחושבים ברמת התור או ברמת הציפייה (השיחה), כפי שמצוין במסוף.
בכל המקרים, אפשר להתאים אישית את הערכים שנדרשים כדי שההפעלה תעבור בתפריט הגדרות בכרטיסייה הערכה.
נכונות הכלי
החישוב מתבצע למקרים לבדיקה מסוג golden ו-scenario. המדד הזה משקף את אחוז הפרמטרים הצפויים שתאמו לפרמטרים בפונקציה הצפויה ולערכי הפרמטרים הצפויים שלה. הציון של קריאות שלא נענו לכלים הוא 0, והציון של קריאות לכלים ללא פרמטרים של קלט הוא 1 אם הן קיימות. אם מתבצעת קריאה לא צפויה לכלי במהלך הערכה מוזהבת, התוצאה תיחשב ככישלון, אבל זה לא ישפיע על ערך הנכונות של הכלי.
שביעות רצון של משתמשים מהיעד
החישוב מתבצע עבור תרחישים. שביעות רצון של משתמשים מהיעד היא מדד בינארי שנועד להערכות של סימולציות משתמשים. המדד הזה מודד אם המשתמש המדומה חושב שהיעדים שלו הושגו (0=לא, 1=כן). הקלט הוא user_goal כפי שהוגדר בהגדרות המשתמש המדומה, ותמליל של השיחה. אם הערך user_goal לא מציין יעד מפורש או משתמע, ציון הפלט הוא -1.
הזיות
האפשרות הזו זמינה לתרחישי בדיקה מוזהבים. ציוני ההזיות מחושבים לכל תור שנוצר. המדד הזה משקף אם הסוכן הציג טענות שלא מוצדקות בהקשר של הסוכן (0=לא, 1=כן). ההקשר מורכב מכל התורות הקודמות בשיחה, ממשתני הסשן, מהפעלות הכלים ומההוראות לסוכן. המדד הזה מחושב רק עבור תורות שמכילות קריאות לכלים. הוא לא מזהה הזיות בשיחות עם כלים; ההנחה היא ששיחות עם כלים שמוצגות כהקשר הן נכונות. כדי למזער תוצאות חיוביות שגויות, יכול להיות שהמדד יחזיר את הציון N/A אם התשובה לא מכילה טענות עובדתיות או מכילה רק ידע כללי שכבר נקבע.
אפשר להפעיל ולהשבית הזיות בהגדרות ההערכה.
התאמה סמנטית
החישוב מתבצע עבור מקרים לבדיקה מסוג golden. המדד הזה מודד את מידת ההתאמה בין אמירה של נציג שנצפתה לבין אמירה צפויה של נציג. ההתאמה הסמנטית מחושבת ברמת התור. הערכים שמוחזרים נעים בין 0 (לא עקבי או סותר לחלוטין) ל-4 (עקבי לחלוטין).
ציפיות לגבי תרחישים
החישוב מתבצע עבור תרחישים. המדד הזה מודד אם ההתנהגות של הסוכן הייתה משביעת רצון או לא (0=לא, 1=כן) מבחינת המשתמשים המדומה. יש תמיכה בשני סוגים של ציפיות משתמשים מסימולציה:
- הציפיות לגבי קריאה לכלי: מחושבות באופן דומה לנכונות הקריאה לכלי, עם החריגים הבאים:
- התוצאות הן 0 (לא) או 1 (כן).
- לא מוטלים עונשים על קריאות לא צפויות לכלים. הציפיות נועדו לציין את קבוצת קריאות הכלים שחיוניות כדי שהשיחה תעמוד בציפיות של המשתמש המדומה.
- כשמתקבל קלט שמתאים לציפייה של קריאה לכלי, הקריאה נחסמת ומוחלפת בזמן הריצה בערך מוחזר מדומה.
- ציפיות לתגובת נציג: בודק אם תגובת נציג כלשהי בשיחה מכילה מחרוזת צפויה.
השלמת המשימה
החישוב מתבצע עבור תרחישים. השלמת המשימה היא מדד לאיכות השיחה. הוא בודק אם המטרות של המשתמש הושגו וגם אם התנהגות הסוכן הייתה נכונה. ההגדרה שלו היא:
User_Goal_Satisfied AND no_hallucinations_detected AND Expectations Satisfied
פרסונות
פרסונות הן פרסונות משתמשים מדומה שאפשר להתאים אישית ולהשתמש בהן לבדיקת סוכנים באמצעות תרחישי בדיקה של תרחישים. התכונה הזו שימושית כדי לוודא שהסוכן יקיים אינטראקציה מתאימה עם סוגי המשתמשים האנושיים שהוא צפוי לפגוש בזמן הריצה.
אם לא תבחרו פרסונה, המערכת תבחר פרסונה אקראית לכל תוצאה של תרחיש.
אפשר להשתמש בתכונה הזו עם קלט של טקסט וגם עם קלט של אודיו.
יצירת פרסונה
- כדי ליצור פרסונה, עוברים לכרטיסייה הערכה ולוחצים על ניהול פרסונות (לצד סמל ההגדרות).
- לוחצים על + הוספת פרסונה.
- בתפריט שמופיע, מזינים שם, אישיות משתמש והקשר משתמש נוסף (כמו גיל, מיקום, הסיבה להתקשרות וכו').
- לוחצים על + הוספה.
כדי להריץ הערכה באמצעות פרסונה:
- חוזרים לדף הראשי הערכה ובוחרים תרחיש אחד או יותר של בדיקה. לוחצים על הפעלת הבחירה.
- בחלון שקופץ, בוחרים את האישיות שיצרתם זה עתה מהתפריט הנפתח אישיות ולוחצים על הפעלה.