- משאבי AI לתשתיות של שירותי אירוח שרתים
- מיקום מודעות בהתאם לטופולוגיית האשכול
- מצב הפעולה של האשכול
- תזמון של תחזוקת אשכולות ואמצעי בקרה
- כלי מעקב ואבחון של אשכולות
רוב היכולות של ניהול אשכולות נתמכות רק בקיבולת שמוגבלת להזמנה – תשתית שמשתמשת במודל הקצאת משאבים שמוגבל להזמנה, שתומך רק בסוגי מכונות של GPU באשכול. לגבי קיבולת שמשתמשת במודל הקצאת משאבים אחר, זמינות רק היכולות הבאות לניהול אשכולות:
- משאבי AI לתשתיות של שירותי אירוח שרתים
- מיקום מודעות בהתאם לטופולוגיית האשכול
- ניהול אירועים של מארחים בכמה מופעים
AI infrastructure resources colocation
כשמשתמשים ב-GPU באשכול, כמו A4X Max, A4X, A4, A3 Ultra, A3 Mega ו-A3 High (8 GPUs), אפשר לבקש מכונות מארחות ש-Compute Engine מקצה כמה שיותר קרוב זו לזו. המכונות האלה מציעות את התכונות הבאות:
מערכת Compute Engine מקצה את המכונות כבלוקים של משאבים.
רשת דינמית של למידת מכונה (ML) שמקשרת בין המכונות.
הסידור הזה של המשאבים מצמצם את מספר הקפיצות ברשת ומבצע אופטימיזציה כדי להשיג את זמן האחזור הנמוך ביותר ברשת. כדי לפרוס בלוקים של מכונות שעברו אופטימיזציה לשימוש במאיצים ש-Compute Engine מקצה בצפיפות, אפשר להשתמש באפשרויות הבאות:
כדי לבצע אחת או יותר מהפעולות הבאות, צריך להקצות משאבים בצפיפות זה לזה:
יצירת משאבים שמשתמשים באותו שריון מקום שמור לעתיד ב-AI Hypercomputer או באותו שריון מקום שמור לעתיד במצב יומן.
פריסה של קבוצת מופעי מכונה מנוהלים (MIG) שמשתמשת בבקשות לשינוי גודל ויוצרת את המשאבים באותה בקשה.
מציינים שהמשאבים משתמשים באותה מדיניות מיקום קומפקטית או מדיניות עומס עבודה שמציינת ערך מרחק מקסימלי. ספציפית, המשאבים צריכים להיות קרובים למרחק המקסימלי שמוגדר במדיניות.
המשאבים מוקצים בצפיפות זה לזה על בסיס זמינות, כשמבצעים אחת או יותר מהפעולות הבאות:
יצירת משאבים באותה בקשה עבור מכונות וירטואליות עם הפעלה גמישה.
מציינים שהמשאבים משתמשים באותה מדיניות מיקום קומפקטית או מדיניות עומס עבודה שלא מציינת מרחק מקסימלי.
מיקום שמודע לטופולוגיה של האשכול
אחרי שיוצרים GPU באשכול, אפשר לקבל מידע על הטופולוגיה ברמת הצומת וברמת האשכול. המידע הזה עוזר לכם:
כדאי לשנות את העיצוב של האפליקציה או של עומס העבודה כדי לצמצם עוד יותר את זמן האחזור ברשת.
הסבר על בעיות נפוצות בהוספה לאינדקס והפתרונות שלהן הבעיות האלה יכולות לקרות אם המיקומים של המופעים רחוקים זה מזה באופן לא צפוי.
באופן ספציפי, נתוני טופולוגיה נתמכים באופן הבא:
המידע על הטופולוגיה פועל בצורה הטובה ביותר עם קיבולת שמוגבלת להזמנה, שנדרשת כדי לראות את הטופולוגיה של הזמנה.
במכונות וירטואליות מסוג Spot, פרטי הטופולוגיה מופיעים רק כשמכונה משתמשת במדיניות למיקום קומפקטי או במדיניות עומס עבודה.
למידע נוסף, קראו את המאמרים הבאים:
- לגבי מופעים ואשכולות Slurm, אפשר לעיין במאמר הצגת טופולוגיה של מופעי מחשוב.
- לגבי אשכולות GKE, אפשר לעיין במאמרים הצגת טופולוגיית הצמתים של GKE ותזמון עומסי עבודה של GKE באמצעות תזמון מודע לטופולוגיה (TAS).
מצב הפעולה של האשכול
כשמשריינים קיבולת שמוגבלת להזמנה כדי ליצור מכונות וירטואליות או אשכולות, סוג המכונה שאתם משריינים קובע את מצב ההפעלה של האשכול עבור המכונות הווירטואליות. במצב הזה מוגדרת ההתנהגות של המופעים אחרי שגיאות במארח או דוחות שגויים של המארח. מצבי הפעולה הזמינים למכונה הם מצב מנוהל, שבו Compute Engine מחליף באופן אוטומטי מכונות פגומות, אבל שומר חלק מהקיבולת המוזמנת כדי לספק למכונות את המשאבים הדרושים להפעלה מחדש. או מצב קיבולת מלאה, שבו יש לכם גישה לקיבולת המלאה שהזמנתם אבל אתם אחראים לניהול של כשלים ותחזוקה מתוכננת.
מידע נוסף זמין במאמר בנושא מצב הפעלה של הזמנה.
תזמון תחזוקה של אשכולות ואמצעי בקרה
אתם יכולים לשלוט בתחזוקה של מעבדי GPU מקובצים באמצעות תזמון מודע לטופולוגיה בבלוק של משאבים. היכולת הזו עוזרת לסנכרן שדרוגים כדי שעומסי העבודה יהיו עמידים יותר לאירועים של המארח וכדי לצמצם שיבושים. הגישה הזו עוזרת לשפר את התפוקה האפקטיבית של עומס העבודה.
כדי לאפשר שליטה מלאה באירועי תחזוקה, אפשר להשתמש בתכונות הבאות:
סוג התזמון של התחזוקה
כשמשריינים קיבולת שמוגבלת להזמנה כדי ליצור מכונות וירטואליות או אשכולות של יחידות GPU, אפשר להגדיר איך Compute Engine ישמור על התשתית שבה המכונות פועלות. בהתאם לסוג המכונה שרוצים להשתמש בה עבור המופעים, אפשר לבחור בין תחזוקה מסונכרנת בכל המופעים (grouped) לבין לוחות זמנים שונים לתחזוקה (independent).
מידע נוסף זמין במאמר בנושא סוגים של תזמון תחזוקה.
ניהול אירועים למארחים
אחרי שיוצרים GPU באשכול ומתחילים את עומס העבודה, אפשר להגדיר התראות ולקבל הודעות כשתחזוקה של המופעים או של הבלוקים השמורים מתוזמנת, מתחילה או מסתיימת. אתם יכולים גם לראות את המועד שנקבע לתחזוקה של מכונה או של בלוק שמור, ואם צריך, להתחיל את התחזוקה באופן ידני לפני המועד הזה. האפשרויות האלה עוזרות לכם לשלוט באופן יזום בזמני ההשבתה של עומסי העבודה ולצמצם אותם.
למידע נוסף, קראו את המאמרים הבאים:
כלים לניטור ולאבחון של אשכולות
לצורך מעקב ופתרון בעיות, סוגי מכונות GPU מקובצים כוללים את השירותים הבאים לקיבולת שמוגבלת להזמנה:
תחזית לגבי ירידה ברמת התקינות של מכונות וירטואליות, שעוזרת לכם לזהות מכונות וירטואליות שצפויות לסבול מירידה ברמת התקינות בתוך חמש השעות הבאות.
דיווח על מארח פגום, שאפשר להשתמש בו כדי לסמן בעיות במכונות מארחות ספציפיות.
תמיכה במדדים של Cloud Monitoring, שעוזרים לעקוב אחרי הביצועים של רשתות ושל יחידות GPU.