במאמר הזה מוסבר איך לפתור בעיות שקשורות לביצועים איטיים שזוהו בעומסי עבודה שפועלים במכונות וירטואליות או באשכולות שעברו אופטימיזציה ל-AI.
במאמר מעקב אחר מופעים של Compute Engine וקלאסטרים של Slurm תוכלו לקרוא איך לזהות ביצועים איטיים.
זיהוי של כל המשאבים שנותרו מאחור בעומס העבודה וטיפול בהם: מבצעים את השלבים הבאים:
בודקים אם אפשר להשתמש בזיהוי של עומס חריג בעומס העבודה. כדי לעיין במגבלות ובדרישות לשימוש בזיהוי של מכונות וירטואליות שפועלות ללא הפסקה, אפשר לעיין במאמר בנושא מעקב אחרי מופעים של Compute Engine ואשכולות Slurm.
אם אין לכם אפשרות להשתמש באיתור של מודעות שלא עומדות בדרישות, אתם יכולים להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים נמוכים.
כדי לבדוק אם יש מכונות וירטואליות בעומס העבודה שלכם שמוגדרות כ-stragglers, אפשר לעיין במדדים של זיהוי stragglers.
לדוגמה, כדי להציג את כל המקרים החשודים של תהליכים שמתעכבים בפרויקט שלכם ב-Cloud Monitoring, מבצעים את השלבים הבאים:
-
במסוף Google Cloud , עוברים לדף Dashboards:
אם משתמשים בסרגל החיפוש כדי למצוא את הדף הזה, בוחרים בתוצאה שבה הכותרת המשנית היא Monitoring.
בקטע Type בחלונית המסננים, לוחצים על Google Services.
בעמודה Name (שם), לוחצים על Cluster Director Health Monitoring (מעקב אחר תקינות של Cluster Director).
ייפתח דף הפרטים של לוח הבקרה.
משתמשים בבורר טווח הזמן בסרגל הכלים כדי לבחור את טווח הזמן של הביצועים האיטיים. בדרך כלל, לוקח עד 10 דקות עד שמתקבל דיווח על משתתף שלא הצליח להצטרף.
כדי לבדוק אם יש מכונות וירטואליות בעומס העבודה שלכם שמוגדרות כ-stragglers, מעיינים בקטע Straggler Detection. אפשר להשתמש בשאילתה הזו כדי לבדוק אם בטבלה Suspected Straggler Instances מופיעים מכונות וירטואליות כלשהן עבור עומס העבודה שלכם.
-
בהתאם למספר המכונות הווירטואליות בעומס העבודה שלכם שיש חשד שהן מכונות לא פעילות, פועלים באופן הבא:
אם אף מכונה וירטואלית לא מזוהה כחריגה, צריך לוודא שהזיהוי של חריגות פועל בצורה תקינה. כדי לבדוק אם שירות זיהוי המשאבים הלא פעילים פועל בפרויקט, פועלים לפי ההוראות לצפייה ביומנים של זיהוי משאבים לא פעילים ומציינים את השאילתה לכל היומנים של זיהוי משאבים לא פעילים בפרויקט. לאחר מכן, פועלים לפי השלבים הבאים:
אם בפרויקט שלכם אין יומני זיהוי של תהליכים שמתעכבים, בזמן שמכונות וירטואליות פועלות במשך 10 דקות לפחות, סימן ששירות זיהוי התהליכים שמתעכבים לא פועל בפרויקט. כדי לפתור את הבעיה, פנו ל-Cloud Customer Care או נסו שוב מאוחר יותר.
אחרת, אם וידאתם שהתכונה 'זיהוי חריגים' פועלת בפרויקט שלכם ועומס העבודה תומך בזיהוי חריגים, יכול להיות שהביצועים האיטיים נגרמים מבעיה אחרת. אפשרויות נוספות לפתרון בעיות שקשורות לביצועים איטיים
אם מספר קטן של מכונות וירטואליות בעומס העבודה מדווחות כמכונות וירטואליות שסביר להניח שהן לא פעילות, כדאי לבדוק את האפשרות להעביר את עומס העבודה מהמכונות הווירטואליות האלה. לאחר מכן, פועלים לפי השלבים הבאים:
אם ההעברה משחזרת את הביצועים של עומס העבודה, יכול להיות שהמכונות הווירטואליות החשודות פגומות. לכל מכונה וירטואלית כזו, פועלים לפי השלבים לדיווח על מארח פגום, מגדירים את
FAULT_REASONלערךPERFORMANCEואתDESCRIPTIONלערךstraggler node.אם ההעברה לא משפרת את הביצועים, יכול להיות שיש עוד מכונות וירטואליות שגורמות לבעיות או שהביצועים האיטיים נגרמים מבעיה אחרת. אפשר לבדוק אם יש עוד מכונות וירטואליות בעומס העבודה שלכם שמוגדרות כ'מכונות וירטואליות לא פעילות' או להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים.
אם מספר גדול של מכונות וירטואליות בעומס העבודה מדווחות כבעלות ביצועים נמוכים, כדאי להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים נמוכים.
שימוש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים: אם רשימת המכונות הווירטואליות החשודות שמופיעה בדוח גדולה, או אם הסרת המכונות הווירטואליות החשודות שמופיעות בדוח לא משפרת את הביצועים, אפשר להשתמש באפשרויות אחרות לפתרון בעיות שקשורות לביצועים איטיים, כמו האפשרויות הבאות:
- בדיקת מדדים אחרים לביצועים
- עיון במסמכי תיעוד אחרים לפתרון בעיות. לדוגמה, אפשר לעיין במאמר פתרון בעיות במכונות וירטואליות עם GPU במסמכי העזרה של Compute Engine.