ניהול אירועי תחזוקה של יחידות TPU בתשתית שמנוהלת על ידי Google
מכונות TPU וירטואליות הן מקרים של מכונות וירטואליות של Compute Engine עם חומרת TPU מצורפת. מכונות וירטואליות ב-Compute Engine כפופות לאירועי תחזוקה של מכונות וירטואליות ב-Compute Engine. כל TPU מחובר למכונה וירטואלית ב-Compute Engine, ולכן שימוש ביותר יחידות TPU (לדוגמה, ב-TPU slice) מגדיל את הסיכוי שאחת מהמכונות הווירטואליות שלכם תיתקל באירוע תחזוקה.
במסמך הזה מתוארות גישות לטיפול באירועי תחזוקה של משימות אימון ארוכות טווח ב-TPU. מידע על טיפול באירועי תחזוקה של TPU ב-Google Kubernetes Engine (GKE) זמין במאמר ניהול שיבושים בצומתי GKE עבור GPU ו-TPU.
איך רואים התראות לגבי פעולות תחזוקה קרובות
מעקב אחרי חלונות הזמן לתחזוקה הקרובים של המכונה מאפשר לכם להכין את עומסי העבודה מראש כדי להתמודד עם תחזוקה קרובה עם שיבושים מינימליים. מידע נוסף זמין במאמר בנושא מעקב ותכנון לקראת אירוע תחזוקה של מארח במאמרי העזרה של Compute Engine.
שימוש בנקודות ביקורת לשחזור מהיר מאירועי תחזוקה
נקודות ביקורת הן חיוניות לשחזור מהיר מאירועי תחזוקה, ולכן מומלץ לשמור אותן לעיתים קרובות. מומלץ לשמור נקודות ביקורת כל שעה בערך. אם לא שומרים את ההתקדמות בתהליך האימון לעיתים קרובות מספיק, יש סיכון לאבד הרבה מההתקדמות בגלל אירועי תחזוקה או הפרעות אחרות בתהליך האימון.
בדרך כלל, נקודות ביקורת מתייחסות לכל הפרמטרים השמורים שמשמשים לאימון, כמו משקלים של מודלים. הזמן שנדרש לשמירת נקודת ביקורת יכול לנוע בין שניות לדקות.
למרות שבדרך כלל יחידות TPU מתאוששות אוטומטית מאירועי תחזוקה, יש מקרים חריגים שבהם העבודה לא מופעלת מחדש באופן אוטומטי. במקרה כזה, צריך למחוק את משאבי ה-TPU וליצור אותם מחדש, ולהפעיל מחדש את משימת האימון מנקודת ביקורת שנשמרה.
יש מנגנונים שונים לשמירה ולטעינה של נקודות ביקורת בכל מסגרת ML. בדרך כלל, מודלים נתמכים של Cloud TPU כוללים שמירת נקודות ביקורת. מידע נוסף על יצירת נקודות ביקורת זמין במאמרי העזרה הבאים:
זיהוי אירועי תחזוקה
כדי לדעת אם ומתי התרחש אירוע תחזוקה ב-TPU, צריך לבדוק את יומני הביקורת של אירועי המערכת ב-Cloud Logging. מידע נוסף זמין במאמר בנושא צפייה ביומני אירועים של תחזוקה.
אפשר גם לבדוק אם יש אירועי תחזוקה קרובים באמצעות הפקודה gcloud compute
instances describe.
מידע נוסף זמין במאמר מעקב ותכנון לקראת אירוע תחזוקה של מארח במאמרי העזרה של Compute Engine.
צפייה ביומני אירועים של תחזוקה
אפשר לראות יומנים היסטוריים של אירועי תחזוקה ב-TPU ביומני ביקורת של אירועי מערכת.
בתפריט הניווט במסוף Google Cloud , עוברים לדף Logs Explorer:
כדי לראות מכונות וירטואליות של TPU שהופסקו לצורך תחזוקה, משתמשים בשאילתת החיפוש הבאה:
"compute.instances.terminateOnHostMaintenance"בתוצאות מוצגים יומני רישום של כל ההפרעות והתיקונים של עובדי ה-TPU בטווח הזמן של החיפוש. היומנים כוללים:
- התאריך והשעה של האירוע
- סוג האירוע
- הסיבה לסגירה בשדה
protoPayload.metadata.terminateReason
התחלת תחזוקה באופן ידני
אתם יכולים להפעיל באופן ידני אירוע תחזוקה ממתין של המארח במכונת ה-TPU שלכם כדי לטפל מראש בתחזוקה הקרובה עם שיבושים מינימליים. למידע נוסף, אפשר לעיין במאמר הפעלה ידנית של אירוע תחזוקה של מארח במאמרי העזרה של Compute Engine.