בחירה בין יחידות GPU כלליות לבין יחידות GPU מקובצות

במסמך הזה מפורטות המלצות לגבי המאיצים, אפשרויות הצריכה וכלי הפריסה שהכי מתאימים לעומסי עבודה שונים של בינה מלאכותית (AI), למידת מכונה (ML) ומחשוב עתיר ביצועים (HPC). המאמר הזה יעזור לכם לזהות את הפריסה הכי טובה לעומס העבודה שלכם.

מידע והמלצות לגבי עמודי התווך של התשתית לעומסי עבודה של AI,‏ ML ו-HPC זמינים במסמכים הבאים:

סקירה כללית של עומסי עבודה

ארכיטקטורת AI Hypercomputer תומכת בתרחישי השימוש הבאים:

עומס עבודה תיאור המלצה
אימון מראש של מודלים בסיסיים התהליך כולל בניית מודל שפה באמצעות מערך נתונים גדול. התוצאה של אימון מראש של מודלים בסיסיים היא מודל חדש שיודע לבצע משימות כלליות.
המודלים מסווגים לפי הגודל שלהם באופן הבא:
  • מודל Frontier: מודלים של למידת מכונה שכוללים מאות מיליארדים עד טריליוני פרמטרים או יותר. הם כוללים מודלים גדולים של שפה (LLM) כמו Gemini.
  • מודל גדול: מודלים של למידת מכונה שכוללים עשרות מיליארדים עד מאות מיליארדים של פרמטרים או יותר.
המלצות לאימון מודלים
כוונון עדין התהליך הזה כולל לקיחת מודל מאומן והתאמתו לביצוע משימות ספציפיות באמצעות מערכי נתונים ייעודיים או טכניקות אחרות. בדרך כלל מבצעים כוונון עדין במודלים גדולים. המלצות לכוונון עדין של מודלים
הסקת מסקנות או הצגה התהליך כולל לקיחת מודל מאומן או מודל שעבר כוונון עדין והפיכתו לזמין לשימוש על ידי משתמשים או אפליקציות.
עומסי עבודה של הסקה מסווגים לפי גודל המודלים באופן הבא:
  • הסקת מסקנות לגבי מודלים בסיסיים בכמה מארחים: ביצוע הסקת מסקנות באמצעות מודלים מאומנים של למידת מכונה שכוללים מאות מיליארדים עד טריליונים של פרמטרים או יותר. עומס החישוב של עומסי העבודה האלה של הסקת מסקנות משותף בין כמה מכונות מארחות.
  • היקש של מודל בסיסי במארח יחיד: ביצוע היקש באמצעות מודלים מאומנים של למידת מכונה (ML) שכוללים עשרות עד מאות מיליארדי פרמטרים. עומסי העבודה האלה של הסקת מסקנות מוגבלים למכונת מארח אחת.
  • הסקת מסקנות ממודל גדול: ביצוע הסקת מסקנות באמצעות מודלים מאומנים או מכווננים של למידת מכונה, שכוללים עשרות עד מאות מיליארדי פרמטרים.
המלצות להסקת מסקנות
ML למודלים קטנים או בינוניים התהליך כולל אימון של מודלים של למידת מכונה (ML) והצגתם. המודלים האלה קטנים יותר בגודלם ובמורכבות שלהם, והם מיועדים בדרך כלל למשימות ספציפיות יותר. המלצות לשימוש ב-ML במודלים קטנים או בינוניים
HPC זוהי שיטה לצבירת משאבי מחשוב כדי להשיג ביצועים טובים יותר מאלה של תחנת עבודה, שרת או מחשב יחידים. משתמשים ב-HPC כדי לפתור בעיות במחקר אקדמי, במדע, בעיצוב, בסימולציה ובבינה עסקית. המלצות ל-HPC

המלצות לאימון מראש של מודלים

כדי לבצע אימון מוקדם של מודלים בסיסיים, אשכולות גדולים של מאיצים קוראים באופן רציף נפחים גדולים של נתונים. ההאצות האלה משנות את המשקלים באמצעות העברות קדימה ואחורה כדי ללמוד מהנתונים. משימות האימון האלה פועלות במשך שבועות או אפילו חודשים בכל פעם.

בקטעים הבאים מפורטים המאיצים ואפשרויות הצריכה שמומלץ להשתמש בהם כדי לבצע אימון מוקדם של מודלים בסיסיים.

מאיצים מומלצים

כדי לבצע אימון מוקדם של מודלים בסיסיים ב- Google Cloud, מומלץ להשתמש בסוגי מכונות שעברו אופטימיזציה למאיצים: A4X Max‏ (NVIDIA GB300),‏ A4X‏ (NVIDIA GB200),‏ A4‏ (NVIDIA B200),‏ A3 Ultra‏ (NVIDIA H200 141GB),‏ A3 Mega‏ (NVIDIA H100 80GB) או A3 High‏ (NVIDIA H100 80GB), ולהשתמש בכלי לתזמור כדי לפרוס את האשכול.

כדי לפרוס את קבוצות המאיצים האלה, מומלץ גם להשתמש ב-Cluster Director או ב-Cluster Toolkit. מידע נוסף זמין במדריך לפריסת אשכולות שמתאים לסוג המכונה שבחרתם, בטבלה הבאה.

עומסי עבודה המלצות מדריך לפריסת אשכול
סוג המכונה Orchestrator
אימון מראש של מודלים בסיסיים
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל
Slurm
אימון מודלים גדולים A3 Ultra (NVIDIA H200 141GB) GKE יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל
Slurm
אימון מודלים גדולים
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE מיקסום רוחב הפס של הרשת של המעבד הגרפי באשכולות במצב רגיל
Slurm

אפשרות מומלצת לצריכה

כדי להגדיל את הסיכוי שתקבלו בוודאות אשכולות גדולים של מאיצים, מומלץ להשתמש בהזמנה. כדי לצמצם את העלויות של משאבים מוזמנים, מומלץ לבקש משך הזמנה ארוך מספיק כדי לקבל הנחות תמורת התחייבות לשימוש. מידע נוסף על אפשרויות צריכה זמין במאמר בחירת אפשרות צריכה.

המלצות לכוונון עדין של מודלים

כדי לבצע התאמה עדינה של מודלים גדולים של בסיס, אשכולות קטנים יותר של מאיצים קוראים נפחים מתונים של נתונים. ההאצות האלה משנות את המודל כדי לבצע משימות ספציפיות. תהליך ההתאמה העדינה של המודלים נמשך ימים או אפילו שבועות.

בקטעים הבאים מפורטים המאיצים המומלצים ואפשרויות הצריכה המומלצות לשימוש כשמבצעים כוונון עדין של מודלים.

כדי לכוונן מודלים ב- Google Cloud, מומלץ להשתמש בסוגי מכונות שעברו אופטימיזציה למאיצים: A3 Ultra (NVIDIA H200 141GB),‏ A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB), ולהשתמש בכלי לתזמור כדי לפרוס את האשכול.

כדי לפרוס את קבוצות המאיצים האלה, מומלץ גם להשתמש ב-Cluster Director או ב-Cluster Toolkit. מידע נוסף זמין במדריך לפריסת אשכולות שמתאים לסוג המכונה שבחרתם, בטבלה הבאה.

עומסי עבודה המלצות מדריך לפריסת אשכול
סוג המכונה Orchestrator
כוונון עדין של מודלים גדולים A3 Ultra (NVIDIA H200 141GB) GKE יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל
Slurm
כוונון עדין של מודלים גדולים
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE מיקסום רוחב הפס של הרשת של המעבד הגרפי באשכולות במצב רגיל
Slurm

אפשרות מומלצת לצריכה

כדי לכוונן עומסי עבודה, משתמשים במקום שמור לעתיד במצב יומן כדי להקצות משאבים. מידע נוסף על אפשרויות הצריכה מפורט במאמר בחירת אפשרות צריכה.

המלצות להסקת מסקנות

בקטעים הבאים מפורטים המאיצים המומלצים ואפשרויות הצריכה שמומלץ להשתמש בהם כשמבצעים הסקה.

מאיצים מומלצים

המאיצים המומלצים להסקת מסקנות תלויים בסוג ההסקה שאתם מבצעים: הסקה של מודל גדול או הסקה של מודל גבול רב-מארח, או הסקה של מודל גבול במארח יחיד.

מאיצים מומלצים (מרובי מארחים)

כדי לבצע הסקה של מודלים גדולים או מודלים מתקדמים בכמה מארחים ב- Google Cloud, צריך להשתמש בסוגי מכונות שעברו אופטימיזציה למאיצים: A4X Max‏ (NVIDIA GB300),‏ A4X‏ (NVIDIA GB200),‏ A4‏ (NVIDIA B200),‏ A3 Ultra‏ (NVIDIA H200 141GB),‏ A3 Mega‏ (NVIDIA H100 80GB) או A3 High‏ (NVIDIA H100 80GB), ולפרוס את המכונה באמצעות כלי תזמור. כדי לפרוס את אשכולות המאיצים האלה, מומלץ גם להשתמש ב-Cluster Director או ב- Cluster Toolkit. בטבלה מופיעים קישורים למדריכים לפריסת אשכולות לכל סוג מומלץ של מכונה.

עומסי עבודה המלצות מדריך לפריסת אשכול
סוג המכונה Orchestrator
הסקת מסקנות לגבי אתרים עם כמה מארחים
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל
Slurm
הסקת מסקנות במודל גדול A3 Ultra (NVIDIA H200 141GB) GKE יצירת אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרת ברירת מחדל
Slurm
הסקת מסקנות במודל גדול
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE מיקסום רוחב הפס של הרשת של המעבד הגרפי באשכולות במצב רגיל
Slurm

מאיצים מומלצים (מארח יחיד)

בטבלה הבאה מפורטים המאיצים שמומלץ להשתמש בהם כדי לבצע הסקה של Frontier במארח יחיד. בטבלה מופיעים קישורים למדריכים לפריסת מכונות וירטואליות לכל סוג מכונה מומלץ.

עומסי עבודה המלצות מדריך לפריסת מכונות וירטואליות
סוג המכונה Orchestrator
הסקת מסקנות (Inference) בשרת יחיד, בטכנולוגיות מתקדמות ובטכנולוגיות מיינסטרים
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141GB)
לא רלוונטי יצירת מכונת A4 או A3 Ultra
  • A3 High (NVIDIA H100 80GB)
  • A3 Edge (NVIDIA H100 80GB)
יצירת מופע A3 High או A3 Edge
G4 (NVIDIA RTX PRO 6000) יצירת מופע G4
A2 (NVIDIA A100) יצירת מופע A2
G2 (NVIDIA L4) יצירת מופע G2
N1 (NVIDIA T4 או V100) יצירת מופע N1

אפשרות מומלצת לצריכה

לצורך הסקת מסקנות, אפשר להשתמש בהזמנה לטווח ארוך או בהזמנה עתידית במצב לוח שנה. מידע נוסף על אפשרויות צריכה זמין במאמר בחירת אפשרות צריכה.

המלצות למודלים קטנים או בינוניים

בעומסי עבודה של ML שכוללים מודלים קטנים עד בינוניים, חשוב מאוד להגיע לאיזון אופטימלי בין מחיר לביצועים.

מאיצים מומלצים

בטבלה הבאה מפורטים המאיצים המומלצים לשימוש בעומסי עבודה של למידת מכונה במודלים קטנים עד בינוניים.

עומסי עבודה המלצות מדריך לפריסת מכונות וירטואליות
סוג המכונה Orchestrator
‫ML למודלים קטנים או בינוניים G4 (NVIDIA RTX PRO 6000) לא רלוונטי יצירת מופע G4
G2 (NVIDIA L4) יצירת מופע G2
A2 (NVIDIA A100) יצירת מופע A2
A3 Edge (NVIDIA H100 80GB) יצירת מופע A3 Edge
N1 (NVIDIA T4 או V100) יצירת מופע N1

המלצות ל-HPC

עבור עומסי עבודה של HPC, כל סדרת מכונות שמותאמת למאיצים או סדרת מכונות שמותאמת לצריכת מעבד גבוהה מתאימה. אם משתמשים בסדרת מכונות שעברה אופטימיזציה לשימוש במאיץ, הסוג המתאים ביותר תלוי בכמות החישובים שצריך להעביר ל-GPU. רשימה מפורטת של המלצות לעומסי עבודה של HPC מופיעה במאמר בנושא שיטות מומלצות להפעלת עומסי עבודה של HPC.

סיכום ההמלצות

בטבלה הבאה מפורטים המאיצים המומלצים ואפשרויות הצריכה לכל עומס עבודה.

משאב המלצה
אימון מראש של המודל
משפחת מכונות משתמשים באחד מסוגי המכונות הבאים שעברו אופטימיזציה להאצה: A4X Max (NVIDIA GB300),‏ A4X (NVIDIA GB200),‏ A4 (NVIDIA B200),‏ A3 Ultra (NVIDIA H200 141GB),‏ A3 Mega (NVIDIA H100 80GB) או A3 High (NVIDIA H100 80GB)
אפשרות צריכה 'שימוש במקומות שמורים לעתיד רגילים
כוונון עדין של מודלים
משפחת מכונות שימוש בסוגי מכונות שעברו אופטימיזציה להאצה: A3 Ultra‏ (NVIDIA H200 141GB),‏ A3 Mega‏ (NVIDIA H100 80GB) או A3 High‏ (NVIDIA H100 80GB)
אפשרות צריכה 'שימוש במקומות שמורים לעתיד רגילים
הסקת מסקנות
משפחת מכונות אפשר להשתמש באחד מסוגי המכונות הבאים: A4X Max (NVIDIA GB300),‏ A4X (NVIDIA GB200),‏ A4 (NVIDIA B200),‏ A3 Ultra (NVIDIA H200 141GB),‏ A3 Mega (NVIDIA H100 80GB),‏ A3 High (NVIDIA H100 80GB),‏ G2 (NVIDIA L4),‏ G4 (NVIDIA RTX PRO 6000),‏ A2 (NVIDIA A100),‏ A3 Edge (NVIDIA H100 80GB) או N1 (NVIDIA T4 או V100)
אפשרות צריכה שימוש במקומות שמורים, במקומות שמורים על פי דרישה או במקומות פנויים
‫ML למודלים קטנים או בינוניים
משפחת מכונות משתמשים באחד מסוגי המכונות הבאים: G2‏ (NVIDIA L4),‏ G4‏ (NVIDIA RTX PRO 6000),‏ A2‏ (NVIDIA A100),‏ A3 Edge‏ (NVIDIA H100 80GB) או N1‏ (NVIDIA T4 או V100)
אפשרות צריכה שימוש בהזמנות על פי דרישה, בהזמנות Spot או בהזמנות רגילות
אחסון שימוש ב-Cloud Storage FUSE
HPC
סיכום השיטות המומלצות להרצת עומסי עבודה של HPC

המאמרים הבאים