יצירת אשכול Slurm מנוהל במלואו לעומסי עבודה של AI

במאמר הזה נסביר איך להגדיר ולפרוס אשכול Slurm מנוהל באופן מלא באמצעות Cluster Director עם סוגי המכונות A4X,‏ A4,‏ A3 Ultra או A3 Mega. מידע נוסף על סוגי המכונות האלה שעברו אופטימיזציה לשימוש במאיצים זמין במאמר מידע על מאיצי GPU.

‫Cluster Director הוא מוצר Google Cloud שמבצע אוטומטית את ההגדרה והקביעה של אשכולות Slurm. המוצר הזה מיועד לאדמינים בתחום ה-IT ולחוקרי AI שרוצים להימנע מהעלויות של ניהול אשכול ולהתמקד בהרצת עומסי העבודה שלהם. אם אתם רוצים יותר שליטה על פריסת האשכול, אתם יכולים ליצור את האשכול באמצעות Cluster Toolkit.

מגבלות

בהתאם לסוג המכונה שבה נעשה שימוש במכונות של Compute Engine באשכול, חלות המגבלות הבאות:

A4X

A4

  • לא מקבלים הנחות על שימוש קבוע והנחות גמישות תמורת התחייבות לשימוש על מופעים שמשתמשים בסוג מכונה A4.
  • אפשר להשתמש בסוג המכונה A4 רק באזורים ובאזורי זמינות מסוימים.
  • אי אפשר להשתמש בדיסק לאחסון מתמיד (אזורי או של תחום מוגדר). אפשר להשתמש רק ב-Google Cloud Hyperdisk.
  • סוג המכונה A4 זמין רק בפלטפורמת המעבד Emerald Rapids.
  • אי אפשר לשנות את סוג המכונה של מופע לסוג מכונה A4 או מסוג מכונה A4. תצטרכו ליצור מכונה חדשה עם סוג המכונה הזה.
  • סוגי המכונות A4 לא תומכים בדיירות יחידה.
  • אי אפשר להריץ מערכות הפעלה של Windows בסוג מכונה A4.
  • במקרים של מופעי A4, כשמשתמשים ב-ethtool -S כדי לעקוב אחרי רשתות GPU, מוני יציאות פיזיות שמסתיימים ב-_phy לא מתעדכנים. זהו התנהגות צפויה במקרים שבהם נעשה שימוש בארכיטקטורת MRDMA Virtual Function (VF). מידע נוסף זמין במאמר פונקציות MRDMA וכלים לניטור רשת.
  • אי אפשר לצרף דיסקים של Hyperdisk ML שנוצרו לפני 4 בפברואר 2026 לסוגי מכונות A4.

A3 Ultra

A3 Mega

לפני שמתחילים

לפני שיוצרים אשכול Slurm, אם עדיין לא עשיתם זאת, צריך לבצע את השלבים הבאים:

  1. בוחרים אפשרות צריכה: האפשרות שתבחרו לצריכה תקבע איך תקבלו ותשתמשו במשאבי GPU. מידע נוסף זמין במאמר בנושא בחירת אפשרות צריכה.
  2. קבלת קיבולת: התהליך לקבלת קיבולת שונה לכל אפשרות צריכה. כדי לקבל מידע על התהליך להשגת קיבולת לאפשרות הצריכה שבחרתם, אפשר לעיין במאמר סקירה כללית על קיבולת.
  3. מוודאים שיש לכם מספיק מכסת קיבולת ב-Filestore: לפני הפריסה, צריך לוודא שיש לכם מספיק מכסה ב-Filestore באזור היעד. עבור סוגי המכונות A4X,‏ A4,‏ A3 Ultra ו-A3 Mega, נדרש נפח מינימלי של 10 TiB ‏(10,240 GiB) של HIGH_SCALE_SSD (אזורי).

    כדי לבדוק את המכסה או לבקש להגדיל אותה, אפשר לעיין במאמרים הבאים:

  4. אימות מדיניות בנושא קובצי אימג' מהימנים: אם לארגון שבו הפרויקט קיים יש מדיניות בנושא קובצי אימג' מהימנים (constraints/compute.trustedImageProjects), צריך לוודא שהפרויקט clusterdirector-public-images נכלל ברשימת הפרויקטים המותרים. מידע נוסף זמין במאמר בנושא הגדרת כללי מדיניות לגבי תמונות מהימנות.

התפקידים הנדרשים

כדי ליצור אשכול Slurm, אתם צריכים את תפקידי ה-IAM וההרשאות הבאים:

יצירת אשכול Slurm

כדי ליצור אשכול שעבר אופטימיזציה ל-AI באמצעות Cluster Director, מבצעים את השלבים הבאים:

  1. הגדרת תצורות של משאבי מחשוב

  2. הגדרת רשת

  3. הגדרת משאבי אחסון

  4. הגדרת סביבת Slurm

הגדרת תצורות של משאבי מחשוב

כדי להגדיר תצורות של משאבי מחשוב כשיוצרים אשכול, מבצעים את השלבים הבאים:

  1. נכנסים לדף Cluster Director במסוף Google Cloud .

    מעבר אל Cluster Director

  2. לוחצים על Create cluster (יצירת אשכול).

  3. בתיבת הדו-שיח שמופיעה, לוחצים על Reference architecture. ייפתח הדף Create a cluster.

  4. לוחצים על אחת מהתבניות הזמינות. אפשר גם לערוך את התבנית כדי להתאים אותה לצרכים של עומס העבודה.

  5. לוחצים על התאמה אישית.

  6. בקטע Compute (חישוב), בשדה Cluster name (שם האשכול), מזינים שם לאשכול. השם יכול להכיל עד 10 תווים, והוא יכול להכיל רק ספרות או אותיות קטנות (a-z).

  7. כדי להוסיף מידע להגדרת משאבי מחשוב שהוגדרה מראש, או לערוך את המספר והסוג של מופעי מחשוב שההגדרות מציינות, מבצעים את הפעולות הבאות:

    1. בקטע Compute, לוחצים על Edit resource configuration. מופיע החלונית הוספת הגדרת משאב.

    2. אופציונלי: כדי לשנות את השם של תצורת משאב המחשוב, בשדה Name (שם) מזינים שם חדש.

    3. אופציונלי: כדי לשנות את המספר והסוג של מופעי החישוב שבהם משתמש האשכול, בקטע Machine configuration, פועלים לפי ההנחיות כדי לעדכן את משאבי החישוב.

    4. בקטע אפשרויות צריכה, מציינים את אפשרות הצריכה שבה רוצים להשתמש כדי לקבל משאבים:

      • כדי ליצור מכונות מחשוב באמצעות הזמנה:

        1. לוחצים על הכרטיסייה Use reservation.

        2. לוחצים על בחירת הזמנה. מופיע החלונית בחירת הזמנה. אם רוצים להשתמש בהזמנה של מכונות וירטואליות מסוג A4X, אפשר לבחור בלוק או תת-בלוק כדי לשלוט במיקום של המכונות הווירטואליות.

        3. בוחרים את ההזמנה שרוצים להשתמש בה. אחר כך לוחצים על בחירה. הפעולה הזו מגדירה באופן אוטומטי את האזור והתחום של משאבי המחשוב.

      • כדי ליצור מכונות וירטואליות עם הפעלה גמישה:

        1. לוחצים על הכרטיסייה תשלום גמיש.

        2. בקטע Time limit for the VM, מציינים את משך ההפעלה של מכונות ה-Compute. הערך צריך להיות בין 10 דקות ל-7 ימים.

        3. בקטע Location, בוחרים את האזור שבו רוצים ליצור מכונות וירטואליות עם הפעלה גמישה.Google Cloud המסוף מסנן באופן אוטומטי את האזורים הזמינים כדי להציג רק את האזורים שתומכים במכונות וירטואליות עם הפעלה גמישה עבור סוג המכונה שבחרתם.

      • כדי ליצור מכונות וירטואליות זמניות מסוג Spot:

        1. לוחצים על הכרטיסייה שימוש בנקודות.

        2. ברשימה On VM termination בוחרים באחת מהאפשרויות הבאות:

          • כדי למחוק מכונות וירטואליות מסוג Spot כשהן מפסיקות לפני הזמן, בוחרים באפשרות מחיקה.

          • כדי לעצור מכונות וירטואליות מסוג Spot בהפסקת שימוש, בוחרים באפשרות Stop.

        3. בקטע Location, בוחרים את Region ו-Zone שבהם רוצים ליצור מכונות Spot.Google Cloud המסוף מסנן אוטומטית את האזורים הזמינים כדי להציג רק את האזורים שתומכים במכונות וירטואליות מסוג Spot עבור סוג המכונה שבחרתם.

    5. לוחצים על סיום.

    6. אופציונלי: כדי ליצור הגדרות נוספות של משאבי מחשוב למחיצה, לוחצים על הוספת הגדרת משאבים ופועלים לפי ההנחיות כדי לציין את משאבי המחשוב.

  8. לוחצים על Continue.

הגדרת רשת

כדי להגדיר את הרשת שבה האשכול משתמש, מבצעים את השלבים הבאים:

  1. בקטע בחירת רשת של ענן וירטואלי פרטי (VPC), מבצעים אחת מהפעולות הבאות:

    • מומלץ: כדי לאפשר ל-AI Hypercomputer ליצור באופן אוטומטי רשת VPC שהוגדרה מראש עבור האשכול, מבצעים את הפעולות הבאות:

      1. בוחרים באפשרות יצירת רשת VPC חדשה.

      2. בשדה Network name, מזינים שם לרשת ה-VPC.

    • כדי להשתמש ברשת VPC או ברשת VPC משותפת קיימת:

      1. בוחרים באפשרות Use a VPC network in the current project (שימוש ברשת VPC בפרויקט הנוכחי) או באפשרות Use a Shared VPC network hosted in another project (שימוש ברשת VPC משותפת שמתארחת בפרויקט אחר).

      2. ברשימה Select VPC network (בחירת רשת VPC) או Shared VPC network (רשת VPC משותפת), בוחרים רשת VPC או רשת VPC משותפת שעומדת בדרישות ההגדרה.

      3. ברשימה Select subnetwork, בוחרים רשת משנה קיימת.

  2. לוחצים על Continue.

הגדרת משאבי אחסון

כשיוצרים אשכול מתבנית של Cluster Director,‏ Cluster Director מגדיר באופן אוטומטי מופע של Filestore או של Managed Lustre כמשאב האחסון של האשכול.

כדי להוסיף או לערוך את משאבי האחסון שבהם נעשה שימוש באשכול, מבצעים את השלבים הבאים בקטע אחסון. מידע נוסף על שירותי האחסון שאפשר להגדיר זמין במאמר שירותי אחסון נתמכים ב-Cluster Director.

  1. אופציונלי: כדי לערוך משאב אחסון, לוחצים על עריכת תוכנית אחסון ופועלים לפי ההנחיות כדי לעדכן את ההגדרות של משאב האחסון.

  2. אופציונלי: כדי להוסיף משאבי אחסון לאשכול, לוחצים על הוספת הגדרת אחסון ופועלים לפי ההנחיות כדי לציין את ההגדרה של משאבי האחסון.

    כדי לראות את שירותי האחסון הזמינים שאפשר להגדיר, אפשר לעיין במאמר שירותי אחסון נתמכים ב-Cluster Director.

  3. לוחצים על Continue.

הגדרת סביבת Slurm

כדי להגדיר את סביבת Slurm באשכול, מבצעים את השלבים הבאים:

  1. אופציונלי: כדי לערוך את המספר ואת הסוג של מכונות ה-Compute שבהן משתמש צומת הכניסה, מרחיבים את הקטע Login node ופועלים לפי ההנחיות כדי לעדכן את משאבי ה-Compute.

  2. אופציונלי: כדי לערוך את המחיצות של האשכול כדי לארגן את משאבי המחשוב, מרחיבים את הקטע Partitions (מחיצות) ומבצעים אחת מהפעולות הבאות:

    • כדי להוסיף מחיצה, לוחצים על הוספת מחיצה ומבצעים את הפעולות הבאות:

      1. בשדה שם המחיצה, מזינים שם למחיצה.

      2. כדי לערוך קבוצת צמתים, לוחצים על החלפת קבוצת צמתים. אחרת, כדי להוסיף קבוצת צמתים, לוחצים על הוספת קבוצת צמתים.

      3. בשדה Nodeset name (שם קבוצת הצמתים), מזינים שם לקבוצת הצמתים.

      4. בשדה Resource configuration (הגדרת משאב), בוחרים הגדרת משאב מחשוב שיצרתם בשלבים הקודמים.

      5. ברשימה Source image (תמונת מקור), בוחרים אחת מתמונות מערכת ההפעלה הנתמכות עבור AI Hypercomputer.

      6. בשדה Static node count (מספר צמתים סטטי) מזינים את המספר המינימלי של מופעי מחשוב שחייבים לפעול תמיד באשכול.

      7. בשדה מספר צמתים דינמי, מזינים את המספר המקסימלי של מכונות וירטואליות ש-AI Hypercomputer יכול להגדיל את גודל האשכול שלהן בזמן עלייה בתנועה.

      8. ברשימה Boot disk type ובשדה Boot disk size, מזינים את הסוג והגודל של דיסק האתחול שמופעלים במופעי המחשוב.

      9. לוחצים על סיום.

    • כדי להסיר מחיצה, לוחצים על מחיקת מחיצה.

  3. אופציונלי: כדי להוסיף תסריטים של פרולוג או אפילוג לסביבת Slurm, מבצעים את הפעולות הבאות:

    1. מרחיבים את הקטע הגדרות מתקדמות של תזמור.

    2. בקטע Scripts (תסריטים), פועלים לפי ההנחיות כדי להוסיף תסריטים.

  4. לוחצים על יצירה. מופיע הדף Clusters. יכול להיות שיעבור קצת זמן עד ליצירת האשכול. הזמן שייקח להשלים את הפעולה תלוי במספר מופעי המחשוב שאתם מבקשים ובזמינות המשאבים באזור של מופעי המחשוב. אם המשאבים שביקשתם לא זמינים, AI Hypercomputer ישמור את בקשת היצירה עד שהמשאבים יהיו זמינים. כדי לראות את הסטטוס של פעולת יצירת האשכול, צריך להציג את פרטי האשכול.

חיבור לאשכול Slurm

כש-AI Hypercomputer יוצר את צומת הכניסה, מצב האשכול משתנה למוכן. אחרי כן תוכלו להתחבר לאשכול, אבל תוכלו להריץ עומסי עבודה רק אחרי ש-AI Hypercomputer ייצור את צמתי החישוב באשכול.

כדי להתחבר לצומת הכניסה של אשכול באמצעות SSH דרך מסוףGoogle Cloud :

  1. נכנסים לדף Clusters במסוף Google Cloud .

    מעבר אל Clusters

  2. בטבלה Clusters (אשכולות), בעמודה Name (שם), לוחצים על שם האשכול שיצרתם בקטע הקודם. יופיע דף עם פרטי האשכול, והכרטיסייה Details תהיה מסומנת.

  3. לוחצים על הכרטיסייה Nodes (צמתים).

  4. בקטע Login nodes (צמתי התחברות), בעמודה Connect (התחברות), מאתרים את צומת ההתחברות של האשכול, ששמו CLUSTER_NAME-login-001.

  5. בעמודה Connect בצומת של ההתחברות, לוחצים על הלחצן SSH. ייפתח חלון SSH בדפדפן.

  6. אם מתבקשים, לוחצים על אישור. יכולות לעבור עד דקה עד שהחיבור לצומת יושלם.

אימות התקינות של אשכול Slurm

לפני שמריצים משימה בצומת מחשוב, Slurm מריץ אוטומטית בדיקה מהירה של תקינות ה-GPU בצומת. אם הצומת לא עובר את הבדיקה, Slurm מרוקן את הצומת ומונע תזמון של משימות חדשות בו.

כדי לבדוק בצורה יסודית יותר את תקינות ה-GPU ואת רוחב הפס של הרשת בצמתי החישוב במחיצת אשכול, אפשר להריץ ידנית בדיקות של NVIDIA Collective Communications Library‏ (NCCL). אם בדיקת NCCL מזהה צמתים לא תקינים, אפשר לתקן את הצמתים או לשנות את האשכול. בדיקות NCCL עוזרות לוודא שהאשכול תקין לפני שמריצים בו עומסי עבודה קריטיים. מידע נוסף זמין במאמר בנושא אימות התקינות של האשכול.

מחיקת אשכול Slurm

כדי למחוק אשכול Slurm בפרויקט, בוחרים באחת מהאפשרויות הבאות:

  1. נכנסים לדף Clusters במסוף Google Cloud .

    מעבר אל Clusters

  2. בטבלה Clusters (אשכולות), בעמודה Name (שם), לוחצים על שם האשכול שרוצים למחוק. יוצג דף עם פרטי האשכול, והכרטיסייה Details תהיה מסומנת.

  3. לוחצים על מחיקה.

  4. בתיבת הדו-שיח שמופיעה, מזינים את שם האשכול ולוחצים על מחיקה כדי לאשר. מופיע הדף Clusters. יכול להיות שיעבור קצת זמן עד שהמחיקה של האשכול תסתיים.

המאמרים הבאים