במסמך הזה מפורטות המלצות לגבי המאיצים, אפשרויות הצריכה וכלי הפריסה שהכי מתאימים לעומסי עבודה שונים של בינה מלאכותית (AI), למידת מכונה (ML) ומחשוב עתיר ביצועים (HPC). המאמר הזה יעזור לכם לזהות את הפריסה הכי טובה לעומס העבודה שלכם.
מידע והמלצות לגבי עמודי התווך של התשתית לעומסי עבודה של AI, ML ו-HPC זמינים במסמכים הבאים:
סקירה כללית של עומסי עבודה
ארכיטקטורת AI Hypercomputer תומכת בתרחישי השימוש הבאים:
| עומס עבודה | תיאור | המלצה |
|---|---|---|
| אימון מראש של מודלים בסיסיים | התהליך כולל בניית מודל שפה באמצעות מערך נתונים גדול. התוצאה של אימון מראש של מודלים בסיסיים היא מודל חדש שיודע לבצע משימות כלליות. המודלים מסווגים לפי הגודל שלהם באופן הבא:
|
המלצות לאימון מודלים |
| כוונון עדין | התהליך הזה כולל לקיחת מודל מאומן והתאמתו לביצוע משימות ספציפיות באמצעות מערכי נתונים ייעודיים או טכניקות אחרות. בדרך כלל מבצעים כוונון עדין במודלים גדולים. | המלצות לכוונון עדין של מודלים |
| הסקת מסקנות או הצגה | התהליך כולל לקיחת מודל מאומן או מודל שעבר כוונון עדין והפיכתו לזמין לשימוש על ידי משתמשים או אפליקציות. עומסי עבודה של הסקה מסווגים לפי גודל המודלים באופן הבא:
|
המלצות להסקת מסקנות |
| ML למודלים קטנים או בינוניים | התהליך כולל אימון של מודלים של למידת מכונה (ML) והצגתם. המודלים האלה קטנים יותר בגודלם ובמורכבות שלהם, והם מיועדים בדרך כלל למשימות ספציפיות יותר. | המלצות לשימוש ב-ML במודלים קטנים או בינוניים |
| HPC | זוהי שיטה לצבירת משאבי מחשוב כדי להשיג ביצועים טובים יותר מאלה של תחנת עבודה, שרת או מחשב יחידים. משתמשים ב-HPC כדי לפתור בעיות במחקר אקדמי, במדע, בעיצוב, בסימולציה ובבינה עסקית. | המלצות ל-HPC |
המלצות לאימון מראש של מודלים
כדי לבצע אימון מוקדם של מודלים בסיסיים, אשכולות גדולים של מאיצים קוראים באופן רציף נפחים גדולים של נתונים. ההאצות האלה משנות את המשקלים באמצעות העברות קדימה ואחורה כדי ללמוד מהנתונים. משימות האימון האלה פועלות במשך שבועות או אפילו חודשים בכל פעם.
בקטעים הבאים מפורטים המאיצים ואפשרויות הצריכה שמומלץ להשתמש בהם כדי לבצע אימון מוקדם של מודלים בסיסיים.
מאיצים מומלצים
כדי לבצע אימון מוקדם של מודלים בסיסיים ב- Google Cloud, מומלץ להשתמש בסוגי מכונות שעברו אופטימיזציה למאיצים: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB), A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB), ולהשתמש בכלי לתזמור כדי לפרוס את האשכול.
כדי לפרוס את קבוצות המאיצים האלה, מומלץ גם להשתמש ב-Cluster Director או ב-Cluster Toolkit. מידע נוסף זמין במדריך לפריסת אשכולות שמתאים לסוג המכונה שבחרתם, בטבלה הבאה.
| עומסי עבודה | המלצות | מדריך לפריסת אשכול | |
|---|---|---|---|
| סוג המכונה | Orchestrator | ||
| אימון מראש של מודלים בסיסיים |
|
GKE | יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל |
| Slurm | |||
| אימון מודלים גדולים | A3 Ultra (NVIDIA H200 141GB) | GKE | יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל |
| Slurm | |||
| אימון מודלים גדולים |
|
GKE | מיקסום רוחב הפס של הרשת של המעבד הגרפי באשכולות במצב רגיל |
| Slurm | |||
אפשרות מומלצת לצריכה
כדי להגדיל את הסיכוי שתקבלו בוודאות אשכולות גדולים של מאיצים, מומלץ להשתמש בהזמנה. כדי לצמצם את העלויות של משאבים מוזמנים, מומלץ לבקש משך הזמנה ארוך מספיק כדי לקבל הנחות תמורת התחייבות לשימוש. מידע נוסף על אפשרויות צריכה זמין במאמר בחירת אפשרות צריכה.
המלצות לכוונון עדין של מודלים
כדי לבצע התאמה עדינה של מודלים גדולים של בסיס, אשכולות קטנים יותר של מאיצים קוראים נפחים מתונים של נתונים. ההאצות האלה משנות את המודל כדי לבצע משימות ספציפיות. תהליך ההתאמה העדינה של המודלים נמשך ימים או אפילו שבועות.
בקטעים הבאים מפורטים המאיצים המומלצים ואפשרויות הצריכה המומלצות לשימוש כשמבצעים כוונון עדין של מודלים.
מאיצים מומלצים
כדי לכוונן מודלים ב- Google Cloud, מומלץ להשתמש בסוגי מכונות שעברו אופטימיזציה למאיצים: A3 Ultra (NVIDIA H200 141GB), A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB), ולהשתמש בכלי לתזמור כדי לפרוס את האשכול.
כדי לפרוס את קבוצות המאיצים האלה, מומלץ גם להשתמש ב-Cluster Director או ב-Cluster Toolkit. מידע נוסף זמין במדריך לפריסת אשכולות שמתאים לסוג המכונה שבחרתם, בטבלה הבאה.
| עומסי עבודה | המלצות | מדריך לפריסת אשכול | |
|---|---|---|---|
| סוג המכונה | Orchestrator | ||
| כוונון עדין של מודלים גדולים | A3 Ultra (NVIDIA H200 141GB) | GKE | יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל |
| Slurm | |||
| כוונון עדין של מודלים גדולים |
|
GKE | מיקסום רוחב הפס של הרשת של המעבד הגרפי באשכולות במצב רגיל |
| Slurm | |||
אפשרות מומלצת לצריכה
כדי לכוונן עומסי עבודה, משתמשים במקום שמור לעתיד במצב יומן כדי להקצות משאבים. מידע נוסף על אפשרויות הצריכה מפורט במאמר בחירת אפשרות צריכה.
המלצות להסקת מסקנות
בקטעים הבאים מפורטים המאיצים המומלצים ואפשרויות הצריכה שמומלץ להשתמש בהם כשמבצעים הסקה.
מאיצים מומלצים
המאיצים המומלצים להסקת מסקנות תלויים בסוג ההסקה שאתם מבצעים: הסקה של מודל גדול או הסקה של מודל גבול רב-מארח, או הסקה של מודל גבול במארח יחיד.
מאיצים מומלצים (מרובי מארחים)
כדי לבצע הסקה של מודלים גדולים או מודלים מתקדמים בכמה מארחים ב- Google Cloud, צריך להשתמש בסוגי מכונות שעברו אופטימיזציה למאיצים: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB), A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB), ולפרוס את המכונה באמצעות כלי תזמור. כדי לפרוס את אשכולות המאיצים האלה, מומלץ גם להשתמש ב-Cluster Director או ב- Cluster Toolkit. בטבלה מופיעים קישורים למדריכים לפריסת אשכולות לכל סוג מומלץ של מכונה.
| עומסי עבודה | המלצות | מדריך לפריסת אשכול | |
|---|---|---|---|
| סוג המכונה | Orchestrator | ||
| הסקת מסקנות לגבי אתרים עם כמה מארחים |
|
GKE | יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל |
| Slurm | |||
| הסקת מסקנות במודל גדול | A3 Ultra (NVIDIA H200 141GB) | GKE | יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל |
| Slurm | |||
| הסקת מסקנות במודל גדול |
|
GKE | מיקסום רוחב הפס של הרשת של המעבד הגרפי באשכולות במצב רגיל |
| Slurm | |||
מאיצים מומלצים (מארח יחיד)
בטבלה הבאה מפורטים המאיצים שמומלץ להשתמש בהם כדי לבצע הסקה של Frontier במארח יחיד. בטבלה מופיעים קישורים למדריכים לפריסת מכונות וירטואליות לכל סוג מכונה מומלץ.
| עומסי עבודה | המלצות | מדריך לפריסת מכונות וירטואליות | |
|---|---|---|---|
| סוג המכונה | Orchestrator | ||
| הסקת מסקנות (Inference) בשרת יחיד, בטכנולוגיות מתקדמות ובטכנולוגיות מיינסטרים |
|
לא רלוונטי | יצירת מכונת A4 או A3 Ultra |
|
יצירת מופע A3 High או A3 Edge | ||
| G4 (NVIDIA RTX PRO 6000) | יצירת מופע G4 | ||
| A2 (NVIDIA A100) | יצירת מופע A2 | ||
| G2 (NVIDIA L4) | יצירת מופע G2 | ||
| N1 (NVIDIA T4 או V100) | יצירת מופע N1 | ||
אפשרות מומלצת לצריכה
לצורך הסקת מסקנות, אפשר להשתמש בהזמנה לטווח ארוך או בהזמנה עתידית במצב לוח שנה. מידע נוסף על אפשרויות צריכה זמין במאמר בחירת אפשרות צריכה.
המלצות למודלים קטנים או בינוניים
בעומסי עבודה של ML שכוללים מודלים קטנים עד בינוניים, חשוב מאוד להגיע לאיזון אופטימלי בין מחיר לביצועים.
מאיצים מומלצים
בטבלה הבאה מפורטים המאיצים המומלצים לשימוש בעומסי עבודה של למידת מכונה במודלים קטנים עד בינוניים.
| עומסי עבודה | המלצות | מדריך לפריסת מכונות וירטואליות | |
|---|---|---|---|
| סוג המכונה | Orchestrator | ||
| ML למודלים קטנים או בינוניים | G4 (NVIDIA RTX PRO 6000) | לא רלוונטי | יצירת מופע G4 |
| G2 (NVIDIA L4) | יצירת מופע G2 | ||
| A2 (NVIDIA A100) | יצירת מופע A2 | ||
| A3 Edge (NVIDIA H100 80GB) | יצירת מופע A3 Edge | ||
| N1 (NVIDIA T4 או V100) | יצירת מופע N1 | ||
המלצות ל-HPC
עבור עומסי עבודה של HPC, כל סדרת מכונות שמותאמת למאיצים או סדרת מכונות שמותאמת לצריכת מעבד גבוהה מתאימה. אם משתמשים בסדרת מכונות שעברה אופטימיזציה לשימוש במאיץ, הסוג המתאים ביותר תלוי בכמות החישובים שצריך להעביר ל-GPU. רשימה מפורטת של המלצות לעומסי עבודה של HPC מופיעה במאמר בנושא שיטות מומלצות להפעלת עומסי עבודה של HPC.
סיכום ההמלצות
בטבלה הבאה מפורטים המאיצים המומלצים ואפשרויות הצריכה לכל עומס עבודה.
| משאב | המלצה |
|---|---|
| אימון מראש של המודל | |
| משפחת מכונות | משתמשים באחד מסוגי המכונות הבאים שעברו אופטימיזציה להאצה: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB), A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB) |
| אפשרות צריכה | 'שימוש במקומות שמורים לעתיד רגילים |
| כוונון עדין של מודלים | |
| משפחת מכונות | שימוש בסוגי מכונות שעברו אופטימיזציה להאצה: A3 Ultra (NVIDIA H200 141GB), A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB) |
| אפשרות צריכה | 'שימוש במקומות שמורים לעתיד רגילים |
| הסקת מסקנות | |
| משפחת מכונות | אפשר להשתמש באחד מסוגי המכונות הבאים: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB), A3 Mega (NVIDIA H100 80GB), A3 High (NVIDIA H100 80GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80GB) או N1 (NVIDIA T4 או V100) |
| אפשרות צריכה | שימוש במקומות שמורים, במקומות שמורים על פי דרישה או במקומות פנויים |
| ML למודלים קטנים או בינוניים | |
| משפחת מכונות | משתמשים באחד מסוגי המכונות הבאים: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80GB) או N1 (NVIDIA T4 או V100) |
| אפשרות צריכה | שימוש בהזמנות על פי דרישה, בהזמנות Spot או בהזמנות רגילות |
| אחסון | שימוש ב-Cloud Storage FUSE |
| HPC | |
| סיכום השיטות המומלצות להרצת עומסי עבודה של HPC | |
המאמרים הבאים
- איך יוצרים אשכול GKE שעבר אופטימיזציה ל-AI
- איך יוצרים אשכול Slurm בניהול מלא
- איך יוצרים מופע שעבר אופטימיזציה באמצעות AI