בחירת תשתית המאיץ

במאמר הזה מוסבר איך לזהות את תשתית ההאצה האופטימלית לעומסי העבודה של הבינה המלאכותית (AI) והלמידה החישובית (ML) בהתאם לשלב במחזור החיים, כמו יצירת אב טיפוס בקנה מידה קטן, הסקת מסקנות בזמן אמת והדרכה מסיבית ומבוזרת. ‫AI Hypercomputer מארגן את המאיצים בשתי קטגוריות: מעבדי GPU כלליים ומעבדי GPU מקובצים.

תשתית GPU

‫AI Hypercomputer מציע שתי קטגוריות שונות של GPU. לכל קטגוריה יש מודל ניהול ייחודי שקובע איך המערכת מטפלת באירועים שקשורים למחזור החיים, מנהלת את התחזוקה ומבצעת אופטימיזציה של הרשת עבור עומס העבודה:

מודל כללי לניהול GPU

מודל ניהול ה-GPU הכללי מיועד לעומסי עבודה שבהם יש עדיפות לעצמאות משאבים ולזמינות גבוהה. המודל הזה משתמש במישור הניהול הרגיל Google Cloud , ומספק חוויה מוכרת לצוותים שכבר משתמשים ב-Compute Engine או ב-GKE.

  • תחזוקה: אסינכרונית. כל מופע מתעדכן בנפרד. בצי של שרתים מרובי-צמתים, אירוע תחזוקה בצומת אחד לא משפיע על הזמינות של צמתים אחרים, כך שאפשר להפנות את התנועה לצמתים תקינים בלי לעצור את כל העבודה.

  • תרחישי שימוש עיקריים: מומלץ למשימות נפוצות כמו הסקת מסקנות בזמן אמת, הפעלת מודלים, יצירת אב טיפוס בקנה מידה קטן וסביבות פיתוח שבהן לא נדרש קנה מידה של מחשוב-על.

סדרות כלליות של מכונות GPU

סדרות המכונות הבאות הן GPUs כלליים:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • ‫A3 High (כרטיס GPU אחד, 2 או 4)

מידע טכני על כל אחת מהמכונות הכלליות של GPU זמין במאמר סוגי מכונות GPU.

מודל ניהול של GPU באשכול

מודל הניהול של GPU באשכולות הוא סביבה ברמת מחשוב-על שמיועדת לאימון מבוזר בהיקף גדול. המשאבים מנוהלים כמערכת יחידה עם צימוד הדוק באמצעות מחסנית GPU מקובצת.

  • תחזוקה: מתואמת. המודל הזה מתאם בין אירועי תחזוקה כדי לתמוך בעומסי עבודה עם צימוד הדוק. באימון מבוזר, אפשר להשתמש בתחזוקה מסונכרנת, שבה העדכונים מוחלים על כל הצמתים בו-זמנית. הגישה הזו מונעת הפעלה מחדש של צמתים שגורמת לעיכובים בעבודות, וממקסמת את התפוקה. המודל הזה מציע גם התראות תחזוקה כל 90 יום.

  • תרחישי שימוש עיקריים: מיועד לאימון מודלים בסיסיים בקנה מידה אקססקייל עם טריליוני פרמטרים או להרצת סימולציות מורכבות של מחשוב עתיר ביצועים (HPC), כמו גילוי תרופות וקיפול חלבונים.

סדרות מכונות GPU באשכול

סדרות המכונות הבאות הן GPU מקובץ:

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • ‫A3 High (8 יחידות GPU)

מידע טכני על כל אחת ממכונות ה-GPU המקובצות זמין במאמר סוגי מכונות GPU.

מטריצת יכולות

השוואה בין המאפיינים הטכניים והתפעוליים של מודלים לניהול GPU כללי ו-GPU מקובץ:

מאפיין מודל כללי לניהול GPU מודל ניהול של GPU באשכול
תרחישים עיקריים לדוגמה הסקת מסקנות, פרסום המודל, יצירת אבות טיפוס ופיתוח אימון מבוזר בקנה מידה גדול ו-HPC
תחזוקה אסינכרוני: עדכונים עצמאיים של צמתים מאפשרים להפנות מחדש את התנועה בלי לעצור את העבודות מתואם: תומך בעדכונים מתואמים (מסונכרנים) בכל האשכול כדי לשמור על סנכרון בין הצמתים ולמקסם את קצב העברת הנתונים
חומרה של מכשיר היעד G2 (L4),‏ G4 (RTX PRO 6000),‏ A2 (A100),‏ N1+T4,‏ A3 Edge ו-A3 High (עם 1, 2 או 4 מעבדי GPU) A4X‏, A4 (Blackwell)‏, A3 Ultra‏, A3 Mega ו-A3 High (8 GPUs)
Networking רישות VPC רגיל דרך ממשקי gVNIC (למעט A3 Edge, שמשתמש ב-GPUDirect-TCPX בכמה רשתות VPC) בדים מיוחדים עם זמן אחזור נמוך (RDMA,‏ RoCE,‏ TCPX או NVIDIA NVLink)
רשימת רשתות בתהליך בחירת הרשת מישור Google Cloud רגיל (Compute Engine או GKE) חבילת ניהול ייעודית (לדוגמה, Cluster Director)
אמינות תיקון אוטומטי רגיל של צמתים וזמן פעולה ברמת ה-Pod חבילה מיוחדת של משאבים ושחזור

מטריצת החלטות

אפשר להשתמש בטבלה הזו כדי לזהות אילו משפחות של ציוד תואמות לכוונת עומס העבודה הספציפי שלכם:

אם עומס העבודה כולל... תשתית GPU מומלצת סדרות מכונות מומלצות
יצירת אב טיפוס ופיתוח יחידות GPU כלליות G2, ‏ G4, ‏ A2, ‏ N1+T4, ‏ A3 Edge
הסקת מסקנות בזמן אמת (פחות מ-100 מיליארד פרמטרים) יחידות GPU כלליות G2, ‏ G4, ‏ A2, ‏ N1+T4, ‏ A3 Edge
הסקת מסקנות בכמה מעבדי GPU קבוצות של יחידות GPU A3, ‏ A4
אימון והסקת מסקנות בקנה מידה גדול קבוצות של יחידות GPU A4, ‏ A3 series
אימון בקנה מידה עצום (מעל 500 מיליארד פרמטרים) והסקת מסקנות מפורקת קבוצות של יחידות GPU A4X Max, ‏ A4X, ‏ A4

לעיון במודל מפורט של עץ החלטות למיפוי ארכיטקטורות של מודלים ישירות לחומרה, אפשר לעבור אל בחירת מאיץ.

אחרי שקובעים את הקריטריונים העיקריים האלה, בוחרים פלטפורמת תזמור. הבחירה הזו תלויה בהעדפה של הצוות שלכם לניהול אוטומטי או לשליטה מדויקת במערכת ההפעלה ובדרייברים.

המאמרים הבאים