אשכולות האימון של פלטפורמת הסוכנים של Gemini Enterprise תומכים במגוון סוגי מכונות כדי להתאים לעומסי עבודה שונים. כשמגדירים את מאגרי הצמתים של האשכול, אפשר לבחור מבין האפשרויות הבאות.
סוגי מכונות וירטואליות שעברו אופטימיזציה למאיצים
| סוג המכונה | GPU | יחידות GPU לכל צומת |
|---|---|---|
a4x-highgpu-4g |
NVIDIA GB200 | 4 |
a4-highgpu-8g |
NVIDIA B200 | 8 |
a3-ultragpu-8g |
NVIDIA H200 | 8 |
a3-megagpu-8g |
NVIDIA H100 | 8 |
g4-standard-48 |
NVIDIA RTX PRO 6000 Blackwell | 1 |
g4-standard-96 |
NVIDIA RTX PRO 6000 Blackwell | 2 |
g4-standard-192 |
NVIDIA RTX PRO 6000 Blackwell | 4 |
g4-standard-384 |
NVIDIA RTX PRO 6000 Blackwell | 8 |
סוגי מכונות של מעבד ו-HPC
| סוג המכונה | תיאור |
|---|---|
משפחת N2: n2-standard-*, n2-highmem-*, n2-highcpu-* |
צמתים לשימוש כללי לעיבוד מקדים של נתונים, לתיאום משימות ולעבודות אחרות שלא דורשות מאיץ. N2 היא גם משפחת המכונות שמשמשת לצמתים של התחברות ל-Slurm. |
משפחת H4D: h4d-standard-*, h4d-highmem-* |
צמתים שעברו אופטימיזציה ל-HPC עם רשת RDMA, לעומסי עבודה של סימולציה ועיבוד מקדים שקשורים זה לזה. |
סוג מכונה A4X
אשכולות האימון של Gemini Enterprise Agent Platform תומכים בסוג המכונה שעבר אופטימיזציה למאיץ A4X (a4x-highgpu-4g), פלטפורמה בקנה מידה אקססקייל שמבוססת על ארכיטקטורת NVIDIA GB200 NVL72 בקנה מידה של מתלה.
השוואה בין ארכיטקטורות
בטבלה הבאה מפורטים ההבדלים הבסיסיים בחומרה בין משפחת A4X לבין משפחות אחרות שעברו אופטימיזציה להאצה.
| תכונה | A4X (a4x-highgpu-4g) | A3 / A4H |
|---|---|---|
| ארכיטקטורת המעבד (CPU) | ARM | X86 |
| מספר יחידות ה-GPU | 4 יחידות GPU לכל צומת | 8 יחידות GPU לכל צומת |
| סוג הזמנה | כל מצבי הקיבולת | מצב מנוהל |
| מדיניות בנושא מיקומי מודעות | מחמיר (קומפקטי) | גמישות |
הנחיות ספציפיות ל-A4X
- מספר המכונות הווירטואליות במאגר הצמתים A4X צריך להיות כפולה של 18 (לדוגמה, 18, 36, 54). זהו שדה חובה כי הקיבולת של A4X מוקצה בבלוקים קבועים של 18 צמתים שלא ניתן לשתף, שנקראים דומיינים של NVLink. הדומיינים האלה כפופים למדיניות למיקום קומפקטי קפדנית, ואי אפשר להשתמש בחלקים של בלוקים שהוקצו על ידי אשכולות אחרים.
- בגלל הארכיטקטורה מבוססת-ARM של צמתי A4X, צריך לבצע שני שינויים מרכזיים בעומסי העבודה של האימון:
- שימוש בקובצי אימג' שתואמים ל-ARM: כל משימות האימון צריכות להשתמש בקובץ אימג' של קונטיינר שנבנה לארכיטקטורת ARM.
- התאמה ל-4 יחידות GPU: צריך לעדכן את לוגיקת האימון המבוזר כדי שתזהה ותשתמש נכון ב-4 יחידות ה-GPU שזמינות בכל צומת A4X.
- תהליך הדיווח על תקלות במארח והשבתה
כשמדווחים על מארח כפגום, חשוב להכיר את תהליך השחזור הבא:
- אין קיבולת המתנה: המערכת לא משתמשת במאגר חלקי חילוף במצב המתנה להחלפת צומת מיידית.
- שחזור על בסיס תיקון: הצומת לא זמין עד שהמארח הפיזי הבסיסי מתוקן.
- השבתה ממושכת: תהליך התיקון הזה נמשך בדרך כלל בין 3 ל-14 ימים.
הקצאת קיבולת
בחירת מודל ההקצאה הנכון היא קריטית כדי לאזן בין עלות, מהירות וזמינות משאבים. אלה אפשרויות ההקצאה:
RESERVATION: הקצאת צמתים מהזמנה ספציפית של Compute Engine שיצרתם מראש. המודל הזה מבטיח קיבולת והוא הבחירה המומלצת למשאבים שיש להם ביקוש גבוה.
FLEX_START: נעשה שימוש ב-Dynamic Workload Scheduler כדי להוסיף את העבודה שלכם לתור. העבודה מתחילה באופן אוטומטי ברגע שמשאבי המחשוב המבוקשים הופכים לזמינים, כך שזמן ההתחלה גמיש ולא נדרש שריון.
SPOT: הקצאת מאגר הצמתים באמצעות מכונות וירטואליות במודל Spot. זו האפשרות הכי חסכונית, אבל כדאי להשתמש בה רק לעומסי עבודה שיכולים להתמודד עם תקלות והפרעות, כי יכול להיות שהמכונות הווירטואליות יידחקו בכל שלב.
ON_DEMAND: זוהי אפשרות ברירת המחדל למאגרי צמתים עם מעבד בלבד, והיא מתאימה במיוחד לסוגי מכונות שלא חסרות. הוא מספק מכונות וירטואליות רגילות עם תמחור צפוי לפי שימוש.
כדאי להיעזר בהנחיות הבאות כדי לבחור את האפשרות המתאימה:
למשאבי GPU עם ביקוש גבוה (כמו A3 ו-A4): מומלץ מאוד להשתמש במודל
RESERVATION. הוא מבטיח לכם גישה ייעודית לקיבולת שאתם צריכים למשימות אימון קריטיות.לעומסי עבודה עם שימוש לא קבוע או גמיש: כדאי לשקול שימוש ב-
FLEX_STARTאו ב-SPOT. FLEX_STARTמוסיף את העבודה שלכם לתור עד שהמשאבים יהיו זמינים, ואילוSPOTמאפשר לכם לחסוך משמעותית בעלויות של עבודות סובלניות לשגיאות שיכולות להתמודד עם קדימות.לסוגי מכונות עם כמות גדולה של נתונים: מומלץ לבחור במודל
ON_DEMAND. אפשר להשתמש בו לסוגי מכונות שלא חסרות ושהזמינות המיידית שלהן לא חשובה.
שימוש בהזמנה משותפת (אופציונלי)
אם רוצים להשתמש בהזמנה משותפת במקום בהזמנה מקומית, צריך לבצע שלבים נוספים לפני שיוצרים אשכול.
לפני שמשתמשים בהזמנה משותפת עם אשכולות אימון של Gemini Enterprise Agent Platform, צריך לוודא שההזמנה המשותפת פועלת על ידי יצירה ידנית של מכונה וירטואלית שמשתמשת בהזמנה המשותפת.
אם יצירת המכונה הווירטואלית הזו עובדת, עוברים לשלב הבא.
בהגדרות ליצירת האשכול, משתמשים בשם ההזמנה בפורמט הבא:
projects/RESERVATION_HOST_PROJECT_ID/zones/RESERVATION_ZONE/reservations/RESERVATION_NAME.
המאמרים הבאים
אחרי שבוחרים את אפשרויות החישוב וההקצאה של אשכול האימון, אפשר ליצור את האשכול ולהריץ בו עומס עבודה.
- יצירת הזמנה ב-Compute Engine: נעשה שימוש במודל
RESERVATIONלהקצאת משאבים שיש להם ביקוש גבוה, כמו יחידות GPU. כדי לקבל גישה ייעודית למשאבים שאתם צריכים, אתם יכולים ליצור שמירת מקום חדשה ב-Compute Engine. - יוצרים את אשכול האימון: כדי ליצור את אשכול האימון המתמשך הראשון באמצעות Agent Platform API או
gcloud, פועלים לפי המדריך המפורט. - שליחת משימת אימון לאשכול: אחרי שהאשכול פעיל, השלב הבא הוא להריץ עומס עבודה. שולחים
CustomJobשמטרתו לבצע פעולות באשכול המתמשך. - התאמת הקוד לאימון מבוזר: כדי לנצל את היתרונות של אשכול מרובה צמתים, צריך להתאים את קוד האימון לסביבה מבוזרת.