מידע על מאיצי GPU

‫AI Hypercomputer מספק תשתית משולבת אנכית שעברה אופטימיזציה לעומסי עבודה תובעניים של בינה מלאכותית (AI) ולמידת מכונה (ML). מעבדי GPU של NVIDIA עם ביצועים גבוהים מסווגים לפי האופן שבו המערכת מטפלת באירועים ובפעולות התחזוקה שקשורים למחזור החיים שלהם: מעבדי GPU כלליים ומעבדי GPU מקובצים.

כדי לזהות את קטגוריית התשתית האופטימלית לעומס העבודה שלכם, תוכלו לעיין במאמר בחירת תשתית להאצת עומסי עבודה.

יחידות GPU כלליות

מעבדים גרפיים כלליים מנוהלים כיחידות מחשוב עצמאיות, באמצעות ממשקי API סטנדרטיים של Compute Engine ו-Google Kubernetes Engine‏ (GKE), כדי לבצע אינטגרציה ישירות עם מישור הבקרה של Google Cloud.

סדרות המכונות שכוללות יחידות GPU כלליות:

  • A3 High עם 1, 2 או 4 מעבדי GPU‏ (NVIDIA H100): אופטימלי לעומסי עבודה של אימון והסקת מסקנות רגילים שלא דורשים אשכול מסונכרן של 8 מעבדי GPU.
  • A3 Edge (NVIDIA H100): ממוטבת להסקת מסקנות שמפוזרת בין כמה מארחים עם תפוקה גבוהה באמצעות רשת VPC רגילה.
  • A2‏ (NVIDIA A100): אופטימיזציה להצגת מודלים בשרתים עם צומת יחיד בביצועים גבוהים ולכוונון עדין בקנה מידה קטן.
  • G4 (NVIDIA RTX PRO 6000): אופטימיזציה להסקת מסקנות ולעומסי עבודה של גרפיקה ברמת כניסה חסכונית.
  • G2 (NVIDIA L4): אופטימלי להסקת מסקנות ול-RAG.
  • N1 (NVIDIA T4 או V100): אופטימיזציה למסקנות ברמת הכניסה ולמשימות מחקר שבהן העלות היא בעדיפות גבוהה יותר מאשר קישוריות בעלות ביצועים גבוהים.

קבוצות של יחידות GPU

מעבדי GPU מקובצים מנוהלים כמערכת יחידה ומקושרת של אלפי מאיצים מחוברים באמצעות Cluster Director.

סדרות המכונות שכוללות GPU באשכול:

שיקולי ביצועים של GPU

כדי להעריך ולשפר את ביצועי עומס העבודה, אפשר לעקוב אחרי מדדים ברמת החומרה, כמו שימוש ב-CUDA core וב-Tensor Core. כדי לעקוב אחרי המשאבים ולהעריך את הביצועים בסביבות כלליות ובסביבות מקובצות, אפשר לעיין במאמרים הבאים:

  • מרכזי בקרה למעקב: מעקב בזמן אמת אחרי השימוש ב-GPU והשימוש בזיכרון עבור מופעים עצמאיים ספציפיים או עבור קבוצות של אשכולות מתואמים.
  • Goodput metrics recipes: measure the percentage of time your accelerators perform useful computation versus system overhead, which is highly recommended for large-scale distributed training on clustered hardware.

המאמרים הבאים