במסמך הזה מוסבר איך להשתמש בהערכת סוכנים כדי למדוד ולשפר את הביצועים, הבטיחות והאיכות של הסוכנים.
מידע נוסף על הערכת מודלים זמין במאמר סקירה כללית על שירות הערכת AI גנרטיבי.
סיכום ההליך
| שלב | פעילות | מטרה |
|---|---|---|
| עיצוב | הגדרת מקרים להערכה | מציינים את המשימות של הסוכן ואת התוצאות הרצויות. |
| הרצה | הרצת הסקת מסקנות | יצירת עקבות של שיחות מהעולם האמיתי או של שיחות מדומה. |
| Scoring | מדדי Compute | דירוג עקבות באמצעות בודקים אוטומטיים (הצלחת המשימה, בטיחות). |
| שיפור | סוכן אופטימיזציה | להציע שיפורים בהוראות או בכלים ולאמת אותם. |
תהליך הבדיקה
ההערכה מתבצעת בתהליך עבודה מובנה ואיטרטיבי:
- הגדרת מקרים להערכה: מקרה להערכה הוא מפרט שמגדיר את המשימה של נציג. מקרה הערכה יכול לכלול שלב שיחה אחד או יותר, את הקשר של השיחה (המצב של הסוכן) ומפרט לסימולציה של תגובות משתמש במהלך ההסקה.
- הפעלת מסקנות: מסקנה היא ההפעלה של תרחיש הערכה. אם בקשת הערכה מכילה תוכנית שיחה, התגובות של המשתמש מדומות במהלך ההסקה.
- יצירת עקבות: כל הרצה של הסקת מסקנות מתעדת את התנהגות הסוכן בעקבות. trace הוא תיעוד עובדתי שלא ניתן לשינוי של התנהגות הסוכן, כולל קלט המודל, התגובות והקריאות לכלים.
- מדדי Compute: מדדים הם ציונים שמחושבים לכל מעקב באמצעות כלים מוכנים מראש או כלים מותאמים אישית. חלק מהמדדים, כמו התאמה מדויקת, הם מבוססי הפניה ודורשים מקרה הערכה עם תשובה לדוגמה. מדדים אחרים, כמו תועלת, הם ללא הפניה ומעריכים את הנתונים באופן עצמאי. ההערכה האוטומטית הזו מאפשרת לכם לתת ציון למעקב אחרי נתונים שצולמו מתנועת נתונים בסביבת ייצור או מיומנים חיצוניים, ללא תלות בסביבת בדיקה מנוהלת.
- עריכת ניתוח: ניתוח מדדים, קריטריונים ופסיקות כדי לזהות בעיות מרכזיות בסוכן, לקשר את הבעיות בסוכן לתרחישי בדיקה וליצור תובנות לשיפור.
- אופטימיזציה של הסוכן: שימוש באופטימיזציה לניהול כל מחזור ההערכה. בתהליך האוטומטי הזה, המערכת מנתחת את התוצאות, מציעה שיפורים לסוכן ומריצה שוב ושוב את התהליך כדי לוודא שהביצועים השתפרו.
תהליך עבודה של הערכה
אפשר לשלב את ההערכה בשני שלבים עיקריים בתהליך העבודה:
- איטרציה של פיתוח מקומי: הערכה מקומית של סוכן שמבוסס על ערכה לפיתוח סוכנים (ADK) כדי לבצע איטרציה מהירה של הנדסת פרומפטים ושל הגדרות כלי.
- הערכת סוכן שנפרס: מדידת האיכות של סוכנים שנפרסו על ידי ניתוח של עקבות היסטוריים או הפעלת מדדים סינתטיים להשוואה מול נקודות קצה של סוכנים.
יכולות הליבה
הערכת סוכן עוזרת לכם ליצור חבילת הערכה ראשונית, גם אם אין לכם נתוני בדיקה קיימים. התכונות הבאות עוזרות להפוך לאוטומטי את התהליך של יצירת תרחישי בדיקה ושיפור המערכות המבוססות על סוכנים:
יצירת תרחישים וסימולציה של משתמשים: יצירה אוטומטית של תרחישי בדיקה סינתטיים מגוונים ורב-שלביים, על סמך ההוראות והגדרות הכלים של הסוכן. האוטומציה הזו מאפשרת לכם להתחיל לבדוק מיד, כי היא מבטלת את הצורך ליצור ידנית תרחישי בדיקה ראשוניים.
סימולציה של סביבה: перехватывать определенные вызовы инструментов для внедрения пользовательских действий, фиктивных данных или смоделированных ошибок (например, ошибок HTTP 503 или скачков задержки). הסימולציה הזו מאפשרת לכם לאמת את עמידות הסוכן בלי להשפיע על קצוות העורף של הייצור.
הערכה רב-שלבית: הערכה אוטומטית של היסטוריית שיחות שלמה באמצעות בודקים אוטומטיים רב-שלביים. המעריכים האלה מנתחים את חילוץ הכוונות, יוצרים באופן דינמי קריטריונים להערכה ומספקים פסקי דין אובייקטיביים של אימות כדי לוודא שההוראות מיושמות.
אופטימיזציה של הנחיות: יצירה ואימות של הוראות מערכת משופרות באופן פרוגרמטי באמצעות אופטימיזציה של הנחיות. מסגרת האופטימיזציה מזהה נקודות כשל ומציעה באופן איטרטיבי עדכונים ממוקדים.
הערכה באמצעות עוזרי תכנות מבוססי-AI
אם אתם משתמשים ב-Gemini CLI או בעוזר תכנות מבוסס-AI אחר, אתם יכולים להתקין מיומנויות של סוכן שמלמדות את העוזר שלכם את מתודולוגיית הערכת הסוכן שמתוארת בדף הזה. כל מיומנות מספקת את תהליך העבודה של ההערכה, סכימת מערך הנתונים, הנחיות לבחירת מדדים ושלבים לניתוח כשלים ישירות בסשן הקידוד, כך שהעוזר הדיגיטלי יכול ליצור הערכות, לדרג אותן ולשפר אותן בלי לצאת מהעורך.
הוראות ההתקנה מופיעות אחרי כל מיומנות.
Agents CLI eval skill
תהליך עבודה מבוסס-CLI להערכה ולאופטימיזציה של סוכנים ב-Agent Development Kit (ADK) באמצעות הפקודות agents-cli eval. המיומנות הזו כוללת:
- הכנת מערכי נתונים להערכה וסינתוז של תרחישים רב-שלביים באמצעות סימולציה של משתמשים
- הרצת הסקה, בדיקת עקבות וניתוח של אשכולות כשלים
- שיפור ההנחיות והכלים באמצעות לולאת הערכה-תיקון
כדי להתקין, מריצים את הפקודה הבאה:
npx skills add https://github.com/google/agents-cli --skill google-agents-cli-eval
יכולת הליבה של Agent Platform GenAI Evaluation Service
מדריך מבוסס-SDK להערכה ולשיפור של מודלים וסוכנים באמצעות שירות ההערכה של AI גנרטיבי ב-Agent Platform, באמצעות Agent Platform GenAI Evaluation SDK (client.evals.evaluate()). המיומנות הזו כוללת:
- יצירת מערכי נתונים להערכה ממעקב אחר סשנים, מ-DataFrames או מיצירה סינתטית
- בחירה, הגדרה וכתיבה של מדדים מותאמים אישית באמצעות ניקוד של מודל שפה גדול (LLM) כשופט
- ניתוח של קביעות קריטריון הערכה ודפוסי הפסד כדי להניע שיפורים קונקרטיים
כדי להתקין, מריצים את הפקודה הבאה:
npx skills add https://github.com/google/skills --skill agent-platform-eval-flywheel