במאמר הזה נסביר איך להגדיר ולפרוס אשכול Slurm מנוהל באופן מלא באמצעות Cluster Director עם סוגי המכונות A4X, A4, A3 Ultra או A3 Mega. מידע נוסף על סוגי המכונות האלה שעברו אופטימיזציה לשימוש במאיצים זמין במאמר מידע על מאיצי GPU.
Cluster Director הוא מוצר Google Cloud שמבצע אוטומטית את ההגדרה והקביעה של אשכולות Slurm. המוצר הזה מיועד לאדמינים בתחום ה-IT ולחוקרי AI שרוצים להימנע מהעלויות של ניהול אשכול ולהתמקד בהרצת עומסי העבודה שלהם. אם אתם רוצים יותר שליטה על פריסת האשכול, אתם יכולים ליצור את האשכול באמצעות Cluster Toolkit.
מגבלות
בהתאם לסוג המכונה שבה נעשה שימוש במכונות של Compute Engine באשכול, חלות המגבלות הבאות:
A4X
- לא תקבלו הנחות על שימוש קבוע או הנחות גמישות תמורת התחייבות לשימוש על מכונות שמשתמשות בסוג המכונה הזה.
- אפשר ליצור מכונות וירטואליות רק באזורים ובאזורי זמינות מסוימים.
- אי אפשר להשתמש בדיסק לאחסון מתמיד (אזורי או של תחום מוגדר). אפשר להשתמש רק ב-Google Cloud Hyperdisk.
- סוג המכונה הזה זמין רק בפלטפורמת NVIDIA Grace.
- אין תמיכה בשינויים בסוג המכונה ב-A4X. כדי לעבור לסוג המכונה הזה או ממנו, צריך ליצור מופע חדש.
- אי אפשר להריץ מערכות הפעלה של Windows בסוג המכונה הזה. רשימה של מערכות הפעלה נתמכות של Linux זמינה במאמר בנושא מערכות הפעלה נתמכות למופעי GPU.
- במקרים של מופעי A4X, כשמשתמשים ב-
ethtool -Sכדי לעקוב אחרי רשתות GPU, המונים של הפורטים הפיזיים שמסתיימים ב-_phyלא מתעדכנים. זהו אופן פעולה צפוי במקרים שבהם נעשה שימוש בארכיטקטורה של פונקציה וירטואלית (VF) של MRDMA. מידע נוסף זמין במאמר פונקציות MRDMA וכלים לניטור רשת. - אין תמיכה במופעי A4X בתכונות הבאות:
- אי אפשר לצרף סוגי מכונות A4X לדיסקים של Hyperdisk ML שנוצרו לפני 4 בפברואר 2026.
A4
- לא מקבלים הנחות על שימוש קבוע והנחות גמישות תמורת התחייבות לשימוש על מופעים שמשתמשים בסוג מכונה A4.
- אפשר להשתמש בסוג המכונה A4 רק באזורים ובאזורי זמינות מסוימים.
- אי אפשר להשתמש בדיסק לאחסון מתמיד (אזורי או של תחום מוגדר). אפשר להשתמש רק ב-Google Cloud Hyperdisk.
- סוג המכונה A4 זמין רק בפלטפורמת המעבד Emerald Rapids.
- אי אפשר לשנות את סוג המכונה של מופע לסוג מכונה A4 או מסוג מכונה A4. תצטרכו ליצור מכונה חדשה עם סוג המכונה הזה.
- סוגי המכונות A4 לא תומכים בדיירות יחידה.
- אי אפשר להריץ מערכות הפעלה של Windows בסוג מכונה A4.
- במקרים של מופעי A4, כשמשתמשים ב-
ethtool -Sכדי לעקוב אחרי רשתות GPU, מוני יציאות פיזיות שמסתיימים ב-_phyלא מתעדכנים. זהו התנהגות צפויה במקרים שבהם נעשה שימוש בארכיטקטורת MRDMA Virtual Function (VF). מידע נוסף זמין במאמר פונקציות MRDMA וכלים לניטור רשת. - אי אפשר לצרף דיסקים של Hyperdisk ML שנוצרו לפני 4 בפברואר 2026 לסוגי מכונות A4.
A3 Ultra
- לא תקבלו הנחות על שימוש קבוע והנחות גמישות תמורת התחייבות לשימוש על מקרים לדוגמה שבהם נעשה שימוש בסוג מכונה A3 Ultra.
- אפשר להשתמש בסוג המכונה A3 Ultra רק באזורים ובאזורי זמינות מסוימים.
- אי אפשר להשתמש בדיסק לאחסון מתמיד (אזורי או של תחום מוגדר). אפשר להשתמש רק ב-Google Cloud Hyperdisk.
- סוג המכונה A3 Ultra זמין רק בפלטפורמת המעבד Emerald Rapids.
- אין תמיכה בשינויים בסוג המכונה עבור סוג המכונה A3 Ultra. כדי לעבור אל סוג המכונה הזה או ממנו, צריך ליצור מופע חדש.
- אי אפשר להריץ מערכות הפעלה של Windows במכונה מסוג A3 Ultra.
- סוגי המכונות A3 Ultra לא תומכים בשימוש בלעדי בדיירים.
- במקרים של מופעי A3 Ultra, כשמשתמשים ב-
ethtool -Sכדי לעקוב אחרי רשתות GPU, מוני יציאות פיזיות שמסתיימים ב-_phyלא מתעדכנים. זהו אופן פעולה צפוי במקרים שבהם נעשה שימוש בארכיטקטורה של פונקציה וירטואלית (VF) של MRDMA. מידע נוסף זמין במאמר פונקציות MRDMA וכלים לניטור רשת.
A3 Mega
- לא מקבלים הנחות על שימוש קבוע והנחות גמישות תמורת התחייבות לשימוש על מקרים שבהם נעשה שימוש בסוג מכונה A3 Mega.
- אפשר להשתמש בסוג המכונה A3 Mega רק באזורים מסוימים.
- אי אפשר להשתמש בדיסק לאחסון מתמיד (persistent disk) אזורי במכונה שמשתמשת בסוג מכונה A3 Mega.
- סוג המכונה A3 Mega זמין רק בפלטפורמת המעבד Sapphire Rapids.
- אין תמיכה בשינויים בסוג המכונה בסוג המכונה A3 Mega. כדי לעבור אל סוג המכונה הזה או ממנו, צריך ליצור מופע חדש.
- אי אפשר להריץ מערכות הפעלה של Windows בסוג המכונה A3 Mega.
לפני שמתחילים
לפני שיוצרים אשכול Slurm, אם עדיין לא עשיתם זאת, צריך לבצע את השלבים הבאים:
- בוחרים אפשרות צריכה: האפשרות שתבחרו לצריכה תקבע איך תקבלו ותשתמשו במשאבי GPU. מידע נוסף זמין במאמר בנושא בחירת אפשרות צריכה.
- קבלת קיבולת: התהליך לקבלת קיבולת שונה לכל אפשרות צריכה. כדי לקבל מידע על התהליך להשגת קיבולת לאפשרות הצריכה שבחרתם, אפשר לעיין במאמר סקירה כללית על קיבולת.
- מוודאים שיש לכם מספיק מכסת קיבולת ב-Filestore: לפני הפריסה, צריך לוודא שיש לכם מספיק מכסה ב-Filestore באזור היעד.
עבור סוגי המכונות A4X, A4, A3 Ultra ו-A3 Mega, נדרש נפח מינימלי של 10 TiB (10,240 GiB) של HIGH_SCALE_SSD (אזורי).
כדי לבדוק את המכסה או לבקש להגדיל אותה, אפשר לעיין במאמרים הבאים:
- כדי לבדוק את המכסה בפרויקט, אפשר לעיין במאמר בנושא הצגה של מכסות על API ספציפי.
- אם אין לכם מספיק מכסה, אתם יכולים לבקש להגדיל את המכסה.
- אימות מדיניות בנושא קובצי אימג' מהימנים: אם לארגון שבו הפרויקט קיים יש מדיניות בנושא קובצי אימג' מהימנים (
constraints/compute.trustedImageProjects), צריך לוודא שהפרויקטclusterdirector-public-imagesנכלל ברשימת הפרויקטים המותרים. מידע נוסף זמין במאמר בנושא הגדרת כללי מדיניות לגבי תמונות מהימנות.
התפקידים הנדרשים
כדי ליצור אשכול Slurm, אתם צריכים את תפקידי ה-IAM וההרשאות הבאים:
-
כדי לקבל את ההרשאות שדרושות להשלמת המדריך הזה, אתם צריכים לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:
-
כדי ליצור ולנהל אשכול: עריכה ב-Cluster Director (
roles/hypercomputecluster.editor) בפרויקט -
כדי ליצור ולנהל מכונות וירטואליות באשכול:
Compute Instance Admin (v1) (
roles/compute.instanceAdmin.v1) בפרויקט -
כדי להשתמש במקום שמור שמשויך לפרויקט יחיד: Compute Instance Admin (v1) (
roles/compute.instanceAdmin.v1) בפרויקט -
כדי לצרוך מקום שמור משותף: Compute Instance Admin (v1) (
roles/compute.instanceAdmin.v1) בפרויקט הבעלים ובכל פרויקט צרכן שבו רוצים לצרוך את המקום השמור. -
כדי להתחבר לצומת הכניסה באשכול:
- Compute OS Login (
roles/compute.osLogin) בפרויקט - משתמש מנהרה באבטחת IAP (
roles/iap.tunnelResourceAccessor) בפרויקט
- Compute OS Login (
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.
-
כדי ליצור ולנהל אשכול: עריכה ב-Cluster Director (
-
כדי לקבל את ההרשאות שדרושות להשלמת המדריך הזה להתחלה מהירה, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים בחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine:
-
כדי ליצור אשכול:
משתמש בחשבון שירות (
roles/iam.serviceAccountUser) -
כדי לנהל משאבים באשכול:
- Logs Writer (
roles/logging.logWriter) - כתיבת מדדי מעקב (
roles/monitoring.metricWriter) - צפייה באובייקטים באחסון (
roles/storage.objectViewer)
- Logs Writer (
-
כדי ליצור אשכול:
משתמש בחשבון שירות (
יצירת אשכול Slurm
כדי ליצור אשכול שעבר אופטימיזציה ל-AI באמצעות Cluster Director, מבצעים את השלבים הבאים:
הגדרת תצורות של משאבי מחשוב
כדי להגדיר תצורות של משאבי מחשוב כשיוצרים אשכול, מבצעים את השלבים הבאים:
נכנסים לדף Cluster Director במסוף Google Cloud .
לוחצים על Create cluster (יצירת אשכול).
בתיבת הדו-שיח שמופיעה, לוחצים על Reference architecture. ייפתח הדף Create a cluster.
לוחצים על אחת מהתבניות הזמינות. אפשר גם לערוך את התבנית כדי להתאים אותה לצרכים של עומס העבודה.
לוחצים על התאמה אישית.
בקטע Compute (חישוב), בשדה Cluster name (שם האשכול), מזינים שם לאשכול. השם יכול להכיל עד 10 תווים, והוא יכול להכיל רק ספרות או אותיות קטנות (
a-z).כדי להוסיף מידע להגדרת משאבי מחשוב שהוגדרה מראש, או לערוך את המספר והסוג של מופעי מחשוב שההגדרות מציינות, מבצעים את הפעולות הבאות:
בקטע Compute, לוחצים על Edit resource configuration. מופיע החלונית הוספת הגדרת משאב.
אופציונלי: כדי לשנות את השם של תצורת משאב המחשוב, בשדה Name (שם) מזינים שם חדש.
אופציונלי: כדי לשנות את המספר והסוג של מופעי החישוב שבהם משתמש האשכול, בקטע Machine configuration, פועלים לפי ההנחיות כדי לעדכן את משאבי החישוב.
בקטע אפשרויות צריכה, מציינים את אפשרות הצריכה שבה רוצים להשתמש כדי לקבל משאבים:
כדי ליצור מכונות מחשוב באמצעות הזמנה:
לוחצים על הכרטיסייה Use reservation.
לוחצים על בחירת הזמנה. מופיע החלונית בחירת הזמנה. אם רוצים להשתמש בהזמנה של מכונות וירטואליות מסוג A4X, אפשר לבחור בלוק או תת-בלוק כדי לשלוט במיקום של המכונות הווירטואליות.
בוחרים את ההזמנה שרוצים להשתמש בה. אחר כך לוחצים על בחירה. הפעולה הזו מגדירה באופן אוטומטי את האזור והתחום של משאבי המחשוב.
כדי ליצור מכונות וירטואליות עם הפעלה גמישה:
לוחצים על הכרטיסייה תשלום גמיש.
בקטע Time limit for the VM, מציינים את משך ההפעלה של מכונות ה-Compute. הערך צריך להיות בין 10 דקות ל-7 ימים.
בקטע Location, בוחרים את האזור שבו רוצים ליצור מכונות וירטואליות עם הפעלה גמישה.Google Cloud המסוף מסנן באופן אוטומטי את האזורים הזמינים כדי להציג רק את האזורים שתומכים במכונות וירטואליות עם הפעלה גמישה עבור סוג המכונה שבחרתם.
כדי ליצור מכונות וירטואליות זמניות מסוג Spot:
לוחצים על הכרטיסייה שימוש בנקודות.
ברשימה On VM termination בוחרים באחת מהאפשרויות הבאות:
כדי למחוק מכונות וירטואליות מסוג Spot כשהן מפסיקות לפני הזמן, בוחרים באפשרות מחיקה.
כדי לעצור מכונות וירטואליות מסוג Spot בהפסקת שימוש, בוחרים באפשרות Stop.
בקטע Location, בוחרים את Region ו-Zone שבהם רוצים ליצור מכונות Spot.Google Cloud המסוף מסנן אוטומטית את האזורים הזמינים כדי להציג רק את האזורים שתומכים במכונות וירטואליות מסוג Spot עבור סוג המכונה שבחרתם.
לוחצים על סיום.
אופציונלי: כדי ליצור הגדרות נוספות של משאבי מחשוב למחיצה, לוחצים על הוספת הגדרת משאבים ופועלים לפי ההנחיות כדי לציין את משאבי המחשוב.
לוחצים על Continue.
הגדרת רשת
כדי להגדיר את הרשת שבה האשכול משתמש, מבצעים את השלבים הבאים:
בקטע בחירת רשת של ענן וירטואלי פרטי (VPC), מבצעים אחת מהפעולות הבאות:
מומלץ: כדי לאפשר ל-AI Hypercomputer ליצור באופן אוטומטי רשת VPC שהוגדרה מראש עבור האשכול, מבצעים את הפעולות הבאות:
בוחרים באפשרות יצירת רשת VPC חדשה.
בשדה Network name, מזינים שם לרשת ה-VPC.
כדי להשתמש ברשת VPC או ברשת VPC משותפת קיימת:
בוחרים באפשרות Use a VPC network in the current project (שימוש ברשת VPC בפרויקט הנוכחי) או באפשרות Use a Shared VPC network hosted in another project (שימוש ברשת VPC משותפת שמתארחת בפרויקט אחר).
ברשימה Select VPC network (בחירת רשת VPC) או Shared VPC network (רשת VPC משותפת), בוחרים רשת VPC או רשת VPC משותפת שעומדת בדרישות ההגדרה.
ברשימה Select subnetwork, בוחרים רשת משנה קיימת.
לוחצים על Continue.
הגדרת משאבי אחסון
כשיוצרים אשכול מתבנית של Cluster Director, Cluster Director מגדיר באופן אוטומטי מופע של Filestore או של Managed Lustre כמשאב האחסון של האשכול.
כדי להוסיף או לערוך את משאבי האחסון שבהם נעשה שימוש באשכול, מבצעים את השלבים הבאים בקטע אחסון. מידע נוסף על שירותי האחסון שאפשר להגדיר זמין במאמר שירותי אחסון נתמכים ב-Cluster Director.
אופציונלי: כדי לערוך משאב אחסון, לוחצים על עריכת תוכנית אחסון ופועלים לפי ההנחיות כדי לעדכן את ההגדרות של משאב האחסון.
אופציונלי: כדי להוסיף משאבי אחסון לאשכול, לוחצים על הוספת הגדרת אחסון ופועלים לפי ההנחיות כדי לציין את ההגדרה של משאבי האחסון.
כדי לראות את שירותי האחסון הזמינים שאפשר להגדיר, אפשר לעיין במאמר שירותי אחסון נתמכים ב-Cluster Director.
לוחצים על Continue.
הגדרת סביבת Slurm
כדי להגדיר את סביבת Slurm באשכול, מבצעים את השלבים הבאים:
אופציונלי: כדי לערוך את המספר ואת הסוג של מכונות ה-Compute שבהן משתמש צומת הכניסה, מרחיבים את הקטע Login node ופועלים לפי ההנחיות כדי לעדכן את משאבי ה-Compute.
אופציונלי: כדי לערוך את המחיצות של האשכול כדי לארגן את משאבי המחשוב, מרחיבים את הקטע Partitions (מחיצות) ומבצעים אחת מהפעולות הבאות:
כדי להוסיף מחיצה, לוחצים על הוספת מחיצה ומבצעים את הפעולות הבאות:
בשדה שם המחיצה, מזינים שם למחיצה.
כדי לערוך קבוצת צמתים, לוחצים על החלפת קבוצת צמתים. אחרת, כדי להוסיף קבוצת צמתים, לוחצים על הוספת קבוצת צמתים.
בשדה Nodeset name (שם קבוצת הצמתים), מזינים שם לקבוצת הצמתים.
בשדה Resource configuration (הגדרת משאב), בוחרים הגדרת משאב מחשוב שיצרתם בשלבים הקודמים.
ברשימה Source image (תמונת מקור), בוחרים אחת מתמונות מערכת ההפעלה הנתמכות עבור AI Hypercomputer.
בשדה Static node count (מספר צמתים סטטי) מזינים את המספר המינימלי של מופעי מחשוב שחייבים לפעול תמיד באשכול.
בשדה מספר צמתים דינמי, מזינים את המספר המקסימלי של מכונות וירטואליות ש-AI Hypercomputer יכול להגדיל את גודל האשכול שלהן בזמן עלייה בתנועה.
ברשימה Boot disk type ובשדה Boot disk size, מזינים את הסוג והגודל של דיסק האתחול שמופעלים במופעי המחשוב.
לוחצים על סיום.
כדי להסיר מחיצה, לוחצים על מחיקת מחיצה.
אופציונלי: כדי להוסיף תסריטים של פרולוג או אפילוג לסביבת Slurm, מבצעים את הפעולות הבאות:
מרחיבים את הקטע הגדרות מתקדמות של תזמור.
בקטע Scripts (תסריטים), פועלים לפי ההנחיות כדי להוסיף תסריטים.
לוחצים על יצירה. מופיע הדף Clusters. יכול להיות שיעבור קצת זמן עד ליצירת האשכול. הזמן שייקח להשלים את הפעולה תלוי במספר מופעי המחשוב שאתם מבקשים ובזמינות המשאבים באזור של מופעי המחשוב. אם המשאבים שביקשתם לא זמינים, AI Hypercomputer ישמור את בקשת היצירה עד שהמשאבים יהיו זמינים. כדי לראות את הסטטוס של פעולת יצירת האשכול, צריך להציג את פרטי האשכול.
חיבור לאשכול Slurm
כש-AI Hypercomputer יוצר את צומת הכניסה, מצב האשכול משתנה למוכן. אחרי כן תוכלו להתחבר לאשכול, אבל תוכלו להריץ עומסי עבודה רק אחרי ש-AI Hypercomputer ייצור את צמתי החישוב באשכול.
כדי להתחבר לצומת הכניסה של אשכול באמצעות SSH דרך מסוףGoogle Cloud :
נכנסים לדף Clusters במסוף Google Cloud .
בטבלה Clusters (אשכולות), בעמודה Name (שם), לוחצים על שם האשכול שיצרתם בקטע הקודם. יופיע דף עם פרטי האשכול, והכרטיסייה Details תהיה מסומנת.
לוחצים על הכרטיסייה Nodes (צמתים).
בקטע Login nodes (צמתי התחברות), בעמודה Connect (התחברות), מאתרים את צומת ההתחברות של האשכול, ששמו
CLUSTER_NAME-login-001.בעמודה Connect בצומת של ההתחברות, לוחצים על הלחצן SSH. ייפתח חלון SSH בדפדפן.
אם מתבקשים, לוחצים על אישור. יכולות לעבור עד דקה עד שהחיבור לצומת יושלם.
אימות התקינות של אשכול Slurm
לפני שמריצים משימה בצומת מחשוב, Slurm מריץ אוטומטית בדיקה מהירה של תקינות ה-GPU בצומת. אם הצומת לא עובר את הבדיקה, Slurm מרוקן את הצומת ומונע תזמון של משימות חדשות בו.
כדי לבדוק בצורה יסודית יותר את תקינות ה-GPU ואת רוחב הפס של הרשת בצמתי החישוב במחיצת אשכול, אפשר להריץ ידנית בדיקות של NVIDIA Collective Communications Library (NCCL). אם בדיקת NCCL מזהה צמתים לא תקינים, אפשר לתקן את הצמתים או לשנות את האשכול. בדיקות NCCL עוזרות לוודא שהאשכול תקין לפני שמריצים בו עומסי עבודה קריטיים. מידע נוסף זמין במאמר בנושא אימות התקינות של האשכול.
מחיקת אשכול Slurm
כדי למחוק אשכול Slurm בפרויקט, בוחרים באחת מהאפשרויות הבאות:
נכנסים לדף Clusters במסוף Google Cloud .
בטבלה Clusters (אשכולות), בעמודה Name (שם), לוחצים על שם האשכול שרוצים למחוק. יוצג דף עם פרטי האשכול, והכרטיסייה Details תהיה מסומנת.
לוחצים על מחיקה.
בתיבת הדו-שיח שמופיעה, מזינים את שם האשכול ולוחצים על מחיקה כדי לאשר. מופיע הדף Clusters. יכול להיות שיעבור קצת זמן עד שהמחיקה של האשכול תסתיים.