סקירה כללית על ניראות

התכונה Agent observability ב-Gemini Enterprise Agent Platform מספקת תצוגה מקיפה של הביצועים, ההתנהגות והתקינות של הסוכנים שנפרסו ושל השרתים של Model Context Protocol‏ (MCP). מעקב אחרי מדדים מרכזיים, מעקב אחרי נתיבי ביצוע והתבוננות במערכת מרובת הסוכנים כמכלול מאפשרים לאבחן בעיות, לבצע אופטימיזציה של צריכת המשאבים ולשפר את המהימנות של הסוכנים.

במסמך הזה מפורטת סקירה כללית על כלי ה-Observability שזמינים ב-Gemini Enterprise Agent Platform, כולל טופולוגיה של המערכת כולה, מעקב אחר סוכנים ספציפיים ומדדים של שרת MCP.

הגדרת טלמטריה

כדי לאכלס את לוחות הבקרה, הטופולוגיות והעקבות האלה של ניראות (observability), צריך להגדיר את הסוכנים לשליחת נתוני טלמטריה בפורמט OpenTelemetry למערכות אחסון ב-Google Cloud Observability.

צריך לוודא שסביבות השרת של הסוכן ושל שרת MCP מוגדרות בצורה תקינה כדי לשדר את הנתונים האלה. רכיבים מובנים Google Cloud פולטים אוטומטית נתוני טלמטריה בפורמט OpenTelemetry. לדוגמה, Model Armor פולט באופן מובנה טלמטריה סטנדרטית, ומאפשר לכם לחשוף ולעקוב בצורה חלקה אחר יירוטים של מדיניות בזמן אמת ישירות בנתוני המעקב, בלי שתצטרכו להשתמש במכשירים מותאמים אישית.

הוראות ודרישות להגדרת טלמטריה של סוכנים מופיעות במקורות המידע הבאים:

אותות ניראות

‫Gemini Enterprise Agent Platform מספק יכולת צפייה באמצעות מדדים, עקבות ויומנים.

כשבוחרים סוכן ספציפי מהמאגר, בכרטיסייה Observability מוצגת חבילה של לוחות בקרה ממוקדים למעקב אחרי התקינות התפעולית, הביצועים וניצול התשתית שלו. אפשר להשתמש בתפריט הניווט שבצד ימין בכרטיסייה Observability כדי לעבור בין התצוגות הבאות:

  • סקירה כללית: מעקב אחר השימוש ברמה גבוהה במהלך פרק הזמן שנבחר, כולל סך הסשנים, מספר הפניות הממוצע לסוכן לכל סשן וסך ההפעלות של הסוכן. בתרשימי סדרות זמן מוצג השימוש בטוקנים (קלט לעומת פלט), נפח התנועה הכולל של הסוכן, אחוזוני חביון (p50,‏ p95,‏ p99) ושיעורי השגיאות.
  • הערכה: מוצגים מסכים אונליין להערכת איכות רציפה. הווידג'טים האלה כוללים מעקב אחר איכות התגובה הממוצעת, מדדי בטיחות, שיעורי הזיות ואיכות השימוש בכלי.
  • מודלים: פירוט הביצועים לפי המודל הבסיסי. אתם יכולים לעקוב אחרי זמן האחזור של p95, המספר הכולל של השיחות, שיעורי השגיאות, כשלים במכסת השימוש ושימוש באסימונים, לפי מודלים ספציפיים.
  • כלים: עוקב אחרי הכלים והשירותים החיצוניים שמחוברים לסוכן. בתצוגה הזו מפורטים נתוני השהיה של אחוזון 95, מספר השיחות ושיעורי השגיאות לכל כלי, וגם התדירות של אינטראקציות שבהן לא נעשה שימוש בכלי.
  • שימוש: מספק מדדים ברמת התשתית לגבי סביבת זמן הריצה של הסוכן, כולל הקצאת CPU לקונטיינר, הקצאת זיכרון לקונטיינר ושימוש באסימונים.
  • יומנים: הצגת נתונים בפורמט של זרם יומנים גולמיים של הסוכן שאפשר לסנן, כולל חומרת הבעיה, חותמות זמן וסיכומי ביצוע, לצורך פתרון בעיות מעמיק. מידע נוסף זמין במאמר בנושא צפייה ביומני סוכנים.

בנוסף ללוחות הבקרה בכרטיסייה Observability, אפשר להשתמש בכרטיסייה Traces של הסוכן כדי לבדוק את ההפעלה של סשנים ספציפיים שלב אחר שלב, כולל גרפים מכוונים לא מחזוריים של טווחים ושל קלט/פלט. מידע נוסף זמין במאמר בנושא הצגת עקבות של סוכנים. אפשר גם להשתמש בכרטיסייה טופולוגיה כדי לראות את התלות הספציפית בכניסה וביציאה של הסוכן היחיד הזה.

בשרתי MCP, אפשר לעקוב אחרי מספר הבקשות ומשך הבקשות p95 כדי לעקוב אחרי השימוש וההיענות.

מוסכמות של OpenTelemetry בנושא AI גנרטיבי

רישומי מעקב של סוכנים ויומני הנחיות ותשובות מסתמכים במידה רבה על המוסכמות הסמנטיות של OpenTelemetry למערכות AI גנרטיבי כדי לתקנן את האופן שבו נתוני טלמטריה של AI גנרטיבי נאספים, מובנים ומדווחים.

חשוב מאוד לפעול בהתאם למוסכמות האלה כדי לעקוב אחרי סוכנים, כי הן יוצרות פורמט אוניברסלי שאינו תלוי בספק, לתיאור תהליכי עבודה מורכבים של סוכנים שכוללים כמה שלבים – כמו הפעלת כלים, שלבי אחזור וצריכת טוקנים. התקן הזה עוזר להבטיח יכולת פעולה הדדית חלקה בין מערכות קצה שונות של ניטור וכלים לניתוח נתונים, גם בתוך Google Cloudוגם מחוצה לו.

המאמרים הבאים