סדרות המכונות עם מעבדי GPU באשכולות, כמו A4X Max,‏ A4X, ‏ A4,‏ A3 Ultra, ‏ A3 Mega ו-A3 High (8 GPUs), נועדו לאפשר לכם להריץ אשכולות של בינה מלאכותית (AI) ולמידת מכונה (ML) בקנה מידה גדול, ולספק את היכולות הבאות לניהול אשכולות:

רוב היכולות של ניהול אשכולות נתמכות רק בקיבולת שמוגבלת להזמנה – תשתית שמשתמשת במודל הקצאת משאבים שמוגבל להזמנה, שתומך רק בסוגי מכונות של GPU באשכול. לגבי קיבולת שמשתמשת במודל הקצאת משאבים אחר, זמינות רק היכולות הבאות לניהול אשכולות:

AI infrastructure resources colocation

כשמשתמשים ב-GPU באשכול, כמו A4X Max,‏ A4X,‏ A4,‏ A3 Ultra,‏ A3 Mega ו-A3 High (8 GPUs), אפשר לבקש מכונות מארחות ש-Compute Engine מקצה כמה שיותר קרוב זו לזו. המכונות האלה מציעות את התכונות הבאות:

הסידור הזה של המשאבים מצמצם את מספר הקפיצות ברשת ומבצע אופטימיזציה כדי להשיג את זמן האחזור הנמוך ביותר ברשת. כדי לפרוס בלוקים של מכונות שעברו אופטימיזציה לשימוש במאיצים ש-Compute Engine מקצה בצפיפות, אפשר להשתמש באפשרויות הבאות:

מיקום שמודע לטופולוגיה של האשכול

אחרי שיוצרים GPU באשכול, אפשר לקבל מידע על הטופולוגיה ברמת הצומת וברמת האשכול. המידע הזה עוזר לכם:

  • כדאי לשנות את העיצוב של האפליקציה או של עומס העבודה כדי לצמצם עוד יותר את זמן האחזור ברשת.

  • הסבר על בעיות נפוצות בהוספה לאינדקס והפתרונות שלהן הבעיות האלה יכולות לקרות אם המיקומים של המופעים רחוקים זה מזה באופן לא צפוי.

באופן ספציפי, נתוני טופולוגיה נתמכים באופן הבא:

  • המידע על הטופולוגיה פועל בצורה הטובה ביותר עם קיבולת שמוגבלת להזמנה, שנדרשת כדי לראות את הטופולוגיה של הזמנה.

  • במכונות וירטואליות מסוג Spot, פרטי הטופולוגיה מופיעים רק כשמכונה משתמשת במדיניות למיקום קומפקטי או במדיניות עומס עבודה.

למידע נוסף, קראו את המאמרים הבאים:

מצב הפעולה של האשכול

כשמשריינים קיבולת שמוגבלת להזמנה כדי ליצור מכונות וירטואליות או אשכולות, סוג המכונה שאתם משריינים קובע את מצב ההפעלה של האשכול עבור המכונות הווירטואליות. במצב הזה מוגדרת ההתנהגות של המופעים אחרי שגיאות במארח או דוחות שגויים של המארח. מצבי הפעולה הזמינים למכונה הם מצב מנוהל, שבו Compute Engine מחליף באופן אוטומטי מכונות פגומות, אבל שומר חלק מהקיבולת המוזמנת כדי לספק למכונות את המשאבים הדרושים להפעלה מחדש. או מצב קיבולת מלאה, שבו יש לכם גישה לקיבולת המלאה שהזמנתם אבל אתם אחראים לניהול של כשלים ותחזוקה מתוכננת.

מידע נוסף זמין במאמר בנושא מצב הפעלה של הזמנה.

תזמון תחזוקה של אשכולות ואמצעי בקרה

אתם יכולים לשלוט בתחזוקה של מעבדי GPU מקובצים באמצעות תזמון מודע לטופולוגיה בבלוק של משאבים. היכולת הזו עוזרת לסנכרן שדרוגים כדי שעומסי העבודה יהיו עמידים יותר לאירועים של המארח וכדי לצמצם שיבושים. הגישה הזו עוזרת לשפר את התפוקה האפקטיבית של עומס העבודה.

כדי לאפשר שליטה מלאה באירועי תחזוקה, אפשר להשתמש בתכונות הבאות:

סוג התזמון של התחזוקה

כשמשריינים קיבולת שמוגבלת להזמנה כדי ליצור מכונות וירטואליות או אשכולות של יחידות GPU, אפשר להגדיר איך Compute Engine ישמור על התשתית שבה המכונות פועלות. בהתאם לסוג המכונה שרוצים להשתמש בה עבור המופעים, אפשר לבחור בין תחזוקה מסונכרנת בכל המופעים (grouped) לבין לוחות זמנים שונים לתחזוקה (independent).

מידע נוסף זמין במאמר בנושא סוגים של תזמון תחזוקה.

ניהול אירועים למארחים

אחרי שיוצרים GPU באשכול ומתחילים את עומס העבודה, אפשר להגדיר התראות ולקבל הודעות כשתחזוקה של המופעים או של הבלוקים השמורים מתוזמנת, מתחילה או מסתיימת. אתם יכולים גם לראות את המועד שנקבע לתחזוקה של מכונה או של בלוק שמור, ואם צריך, להתחיל את התחזוקה באופן ידני לפני המועד הזה. האפשרויות האלה עוזרות לכם לשלוט באופן יזום בזמני ההשבתה של עומסי העבודה ולצמצם אותם.

למידע נוסף, קראו את המאמרים הבאים:

כלים לניטור ולאבחון של אשכולות

לצורך מעקב ופתרון בעיות, סוגי מכונות GPU מקובצים כוללים את השירותים הבאים לקיבולת שמוגבלת להזמנה:

מה השלב הבא?