במאמר הזה מוסבר איך לפתור בעיות שקשורות לביצועים איטיים שזוהו בעומסי עבודה שפועלים במכונות וירטואליות או באשכולות שעברו אופטימיזציה ל-AI.
במאמר מעקב אחר מופעים של Compute Engine וקלאסטרים של Slurm תוכלו לקרוא איך לזהות ביצועים איטיים.
זיהוי של כל המשאבים שנותרו מאחור בעומס העבודה וטיפול בהם: מבצעים את השלבים הבאים:
בודקים אם אפשר להשתמש בזיהוי של עומס יתר בעומס העבודה. כדי לעיין במגבלות ובדרישות לשימוש בזיהוי של מכונות וירטואליות שפועלות ללא הפסקה, אפשר לעיין במאמר בנושא מעקב אחרי מופעים של Compute Engine ואשכולות Slurm.
אם אי אפשר להשתמש בזיהוי של הודעות תקועות, אפשר להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים.
כדי לבדוק אם יש מכונות וירטואליות בעומס העבודה שלכם שמוגדרות כ-stragglers, אפשר לעיין במדדים של זיהוי stragglers.
לדוגמה, כדי להציג את כל המקרים החשודים של תהליכים שמתעכבים בפרויקט שלכם ב-Cloud Monitoring, מבצעים את השלבים הבאים:
-
במסוף Google Cloud , עוברים לדף Dashboards:
אם משתמשים בסרגל החיפוש כדי למצוא את הדף הזה, בוחרים בתוצאה שבה הכותרת המשנית היא Monitoring.
בקטע Type בחלונית המסננים, לוחצים על Google Services.
בעמודה Name (שם), לוחצים על Cluster Director Health Monitoring (מעקב אחר תקינות של Cluster Director).
ייפתח דף הפרטים של לוח הבקרה.
משתמשים בבורר טווח הזמן בסרגל הכלים כדי לבחור את טווח הזמן של הביצועים האיטיים. בדרך כלל, לוקח עד 10 דקות עד שמתקבל דיווח על משתמשים שמתקשים להצטרף לפגישה.
כדי לבדוק אם יש מכונות וירטואליות בעומס העבודה שלכם שמוגדרות כ-stragglers, מעיינים בקטע Straggler Detection. אפשר להשתמש בשאילתה הזו כדי לבדוק אם בטבלה Suspected Straggler Instances מופיעים מכונות וירטואליות כלשהן עבור עומס העבודה שלכם.
-
בהתאם למספר המכונות הווירטואליות בעומס העבודה שלכם שיש חשד שהן מכונות לא פעילות, פועלים באופן הבא:
אם אף מכונה וירטואלית לא מזוהה כחריגה, צריך לוודא שהזיהוי של חריגות פועל בצורה תקינה. כדי לבדוק אם שירות זיהוי המשאבים הלא פעילים פועל בפרויקט, פועלים לפי ההוראות לצפייה ביומנים של זיהוי משאבים לא פעילים ומציינים את השאילתה לכל היומנים של זיהוי משאבים לא פעילים בפרויקט. לאחר מכן, ממשיכים כך:
אם בפרויקט שלכם אין יומני זיהוי של תהליכים מיותרים בזמן שמכונות וירטואליות פועלות במשך 10 דקות לפחות, סימן ששירות זיהוי התהליכים המיותרים לא פועל בפרויקט. כדי לפתור את הבעיה, פנו ל-Cloud Customer Care או נסו שוב מאוחר יותר.
אחרת, אם וידאתם שהתכונה 'זיהוי חריגים' פועלת בפרויקט שלכם ועומס העבודה תומך בזיהוי חריגים, יכול להיות שהביצועים האיטיים נגרמים מבעיה אחרת. אפשרויות נוספות לפתרון בעיות שקשורות לביצועים איטיים
אם מספר קטן של מכונות וירטואליות בעומס העבודה מדווחות כחשודות, כדאי לבדוק את העברת עומס העבודה מהמכונות הווירטואליות החשודות. לאחר מכן, ממשיכים כך:
אם ההעברה משפרת את הביצועים של עומס העבודה, יכול להיות שהמכונות הווירטואליות החשודות פגומות. לכל מכונה וירטואלית כזו, פועלים לפי השלבים לדיווח על מארח פגום, מגדירים את
FAULT_REASONלערךPERFORMANCEואתDESCRIPTIONלערךstraggler node.אם ההעברה לא משפרת את הביצועים, יכול להיות שיש עוד מכונות וירטואליות שגורמות לבעיות או שהביצועים האיטיים נגרמים מבעיה אחרת. אפשר לבדוק אם יש עוד מכונות וירטואליות בעומס העבודה שלכם שמוגדרות כ'מכונות וירטואליות לא פעילות' או להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים.
אם מספר גדול של מכונות וירטואליות בעומס העבודה מדווחות כ'מכונות וירטואליות שמתעכבות', כדאי להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים.
שימוש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים: אם רשימת המכונות הווירטואליות החשודות שדווחה גדולה, או אם הסרת המכונות הווירטואליות החשודות שדווחו לא משפרת את הביצועים, אפשר להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים, כמו האפשרויות הבאות:
- בדיקת מדדים אחרים לביצועים
- עיון במסמכי תיעוד אחרים לפתרון בעיות. לדוגמה, אפשר לעיין במאמר פתרון בעיות במכונות וירטואליות עם GPU במסמכי העזרה של Compute Engine.