הסבר על מעבדי GPU

מעבדים גרפיים (GPU) הם מאיצי חומרה ייעודיים שנועדו לעבד עומסי עבודה מקבילים בו-זמנית. ב-Google Cloud, אתם יכולים לחבר מעבדים גרפיים (GPU) של NVIDIA למכונות Compute Engine ולמכונות Bare Metal כדי להאיץ עומסי עבודה תובעניים, כמו אימון בינה מלאכותית (AI) ולמידת מכונה (ML), מחשוב עתיר ביצועים (HPC), רינדור גרפי והמרת קידוד של סרטונים.

במסמך הזה מופיע סקירה כללית של יחידות ה-GPU ב- Google Cloud, כולל דגמי GPU זמינים, מיפוי של סדרות מכונות, מאפייני ביצועים, תרחישי שימוש אידיאליים ושיקולי תמחור.

מה זה GPU?

מעבד GPU הוא מעבד מקבילי מאסיבי שתוכנן במקור לגרפיקה ממוחשבת, והתפתח למנוע Compute Engine חיוני ל-AI, למידת מכונה (ML) ומחשוב מדעי. בניגוד ליחידות עיבוד מרכזיות (CPU), שמכילות כמה ליבות חזקות שעברו אופטימיזציה לעיבוד רציף של נתונים בשרשור יחיד, יחידות עיבוד גרפיות (GPU) מורכבות מאלפי ליבות קטנות ויעילות מאוד, שנועדו לבצע חישובים מתמטיים בו-זמנית על מערכי נתונים גדולים.

הרכיבים הארכיטקטוניים העיקריים של מערכת GPU הם:

  • ליבות CUDA: יחידות עיבוד וקטוריות למטרות כלליות שמבצעות הוראות בכמה שרשורים מקבילים בו-זמנית באמצעות ארכיטקטורה של הוראה יחידה, שרשורים מרובים (SIMT). ליבות CUDA מטפלות בחישובים סטנדרטיים של וקטורים ונקודות צפות (כמו FP32 ו-FP64), וגם ברינדור גרפי כללי ובסימולציות פיזיקליות.

  • Tensor Cores: יחידות עיבוד מיוחדות של מטריצות כפל-צבירה (MMA) שמיועדות להאצת חישובים של רשתות נוירונים. ליבות Tensor מספקות האצות אקספוננציאליות לאימון AI ולהסקת מסקנות בפורמטים מיוחדים של דיוק מספרי, כולל FP4,‏ FP8,‏ INT8,‏ TF32 ו-FP16/BF16.

  • זיכרון עם רוחב פס גבוה: זיכרון ייעודי במכשיר שמספק רוחב פס של עד כמה טרה-בייט לשנייה (TBps), כמו זיכרון עם רוחב פס גבוה (HBM) או קצב נתונים כפול של גרפיקה (GDDR). התפוקה הגבוהה הזו מאפשרת לספק נתונים לאלפי ליבות GPU במהלך פעולות מטריצה אינטנסיביות.

  • חיבורים מהירים (NVLink ו-NVSwitch): טכנולוגיות חיבור עם רוחב פס גבוה וזמן אחזור נמוך שמחברות בין כמה מעבדי GPU באותו שרת או בין צמתים שונים. ‫NVLink מספק תקשורת ישירה בין מעבדי GPU שעוקפת את אפיק ה-PCIe האיטי יותר, ומאפשרת לקבוצות של מעבדי GPU לפעול כמאגר זיכרון מאיץ יחיד ועקבי.

  • תוכנה לתחנות עבודה וירטואליות (NVIDIA RTX vWS): תוכנה לארגונים שמספקת האצת עיבוד גרפי וירטואלית לתחנות עבודה חזותיות מרחוק, לעיצוב בעזרת מחשב (CAD), ליצירת תוכן דיגיטלי ולמידול תלת-ממדי.

דגמי GPU וסדרות מכונות

‫Google Cloud NVIDIA GPUs זמינים בכמה דורות כדי לענות על צרכים שונים של עומסי עבודה ותקציבים. ב-Compute Engine, מעבדי GPU זמינים כסדרות מכונות מותאמות למאיצים שהוגדרו מראש (סדרות A ו-G) או כמאיצים שאפשר לצרף לסדרות מכונות לשימוש כללי N1.

בטבלה הבאה מפורטות מפרטי החומרה, מיפויים של סדרות מכונות, רוחב פס של רשתות ויכולות אחסון של דגמי GPU שזמינים ב-Compute Engine:

דגם ה-GPU סדרת מכונות ארכיטקטורה זיכרון GPU ורוחב פס מעבדי GPU לכל מכונה רוחב פס מקסימלי ברשת אחסון SSD מקומי Interconnect תמיכה ב-NVIDIA RTX Virtual Workstation‏ (vWS)
NVIDIA GB300 ‫A4X Max Blackwell Ultra ‫279 GB HBM3e (8 TBps) ‫4 (NVL72) ‫3,600 Gbps ‫12,000 GiB ‫NVLink Full Mesh ‏ (1,800 GBps) לא
NVIDIA GB200 A4X Blackwell ‫186 GB HBM3e ‏ (8 TBps) ‫4 (NVL72) ‫2,000 Gbps ‫12,000 GiB ‫NVLink Full Mesh ‏ (1,800 GBps) לא
NVIDIA B200 A4 Blackwell ‫180 GB HBM3e (8 TBps) 8 ‫3,600 Gbps ‫12,000 GiB ‫NVLink Full Mesh ‏ (1,800 GBps) לא
NVIDIA H200 A3 Ultra תא אחסון עליון ‫141 GB HBM3e (4.8 TBps) 8 ‫3,600 Gbps ‫12,000 GiB ‫NVLink Full Mesh ‏ (900 GBps) לא
NVIDIA H100 ‫A3 Mega, ‏ High, ‏ Edge תא אחסון עליון ‫80GB HBM3‏ (3.35TBps) 1, 2, 4, 8 עד ‎1,000 Gbps עד ‎6,000 GiB ‫NVLink Full Mesh ‏ (900 GBps) לא
NVIDIA A100 (80GB) A2 Ultra אמפר ‫80 GB HBM2e ‏ (1.9 TBps) 1, 2, 4, 8 ‫100 Gbps עד ‎3,000 GiB NVLink Full Mesh ‏ (600 GBps) לא
NVIDIA A100 (40GB) ‫A2 Standard אמפר ‫40 GB HBM2 (1.6 TBps) ‫1, 2, 4, 8, 16 ‫100 Gbps עד ‎3,000 GiB NVLink Full Mesh ‏ (600 GBps) לא
NVIDIA RTX PRO 6000 G4 Blackwell ‫96 GB GDDR7 ‏ (1.597 TBps) ‫1/8, ‏ 1/4, ‏ 1/2, ‏ 1, ‏ 2, ‏ 4, ‏ 8 ‫200 Gbps עד ‎3,000 GiB PCIe גרסה 5 כן
NVIDIA L4 G2 אדה לאבלייס ‫24 GB GDDR6 ‏ (300 GBps) 1, 2, 4, 8 ‫100 Gbps עד ‎3,000 GiB PCIe גרסה 4 כן
‫NVIDIA T4
(מתקרב סוף התמיכה)
‫N1+T4 Turing ‫16 GB GDDR6 ‏ (320 GBps) 1, 2, 4 ‫100 Gbps נתמך PCIe Gen 3 כן
NVIDIA V100 ‫N1+V100 Volta ‫16 GB HBM2 ‏ (900 GBps) 1, 2, 4, 8 ‫100 Gbps נתמך NVLink Ring (300 GBps) לא
‫NVIDIA P100
(מתקרב סוף התמיכה)
N1+P100 פסקל ‫16GB HBM2 ‏ (732GBps) 1, 2, 4 ‫100 Gbps נתמך PCIe Gen 3 כן
‫NVIDIA P4
(מתקרב סוף התמיכה)
N1+P4 פסקל ‫8 GB GDDR5 ‏ (192 GBps) 1, 2, 4 ‫100 Gbps נתמך PCIe Gen 3 כן

מאפייני הביצועים של ה-GPU

בחירת מודל ה-GPU הנכון תלויה במאפייני החישוב, בדרישות הזיכרון, בפורמטים של הדיוק ובצרכים של יכולת ההתאמה של עומס העבודה.

תרחישי שימוש אידיאליים ודרישות עומס עבודה

מעבדי GPU מאיצים מגוון רחב של עומסי עבודה חישוביים בתחומי ה-AI, המחשוב הוויזואלי והמודלים המדעיים. כדי להבין את דרישות הארכיטקטורה לכל קטגוריית עומס עבודה, בוחרים באחת מהכרטיסיות הבאות:

אימון AI/ML

  • מודלים בסיסיים של Frontier ותערובת של מומחים (MoE): אימון מוקדם של מודלים גדולים של Transformer, ארכיטקטורות מולטימודאליות ורשתות של תערובת של מומחים (MoE) דורש תפוקה גבוהה של Tensor Core, נפחים גדולים של זיכרון ברוחב פס גבוה (HBM) (עד 279GB לכל GPU) ורוחב פס של קישוריות הדדית של NVLink במהירות גבוהה במיוחד (עד 1,800GBps) כדי למזער את זמן האחזור של סנכרון בין צמתים. סדרת מכונות מומלצת:

    מידע נוסף מופיע במאמר המלצות לאימון מראש של מודלים במאמרי העזרה של AI Hypercomputer.

  • כוונון עדין ואימון מודלים מתון: כדי להתאים מודלים קיימים של מודלי בסיס באמצעות טכניקות כמו כוונון יעיל בפרמטרים (PEFT) וLow-Rank Adaptation (LoRA), נדרש זיכרון GPU מספיק כדי להכיל את משקלי המודל והגרדיאנטים בלי לדרוש אשכולות מרובי צמתים בקנה מידה אקססקייל. סדרות מכונות מומלצות:

    • ‫A3 High (NVIDIA H100)
    • ‫A2 (NVIDIA A100)
    • ‫G4 (NVIDIA RTX PRO 6000)

    מידע נוסף מופיע במאמר המלצות לכוונון עדין של מודלים במאמרי העזרה של AI Hypercomputer.

היקש של AI/ML

  • הסקת מסקנות ממודלים גדולים (יותר מ-70 מיליארד פרמטרים): כדי להפעיל מודלים גדולים של שפה (LLM) צריך קיבולת גבוהה של זיכרון ברוחב פס גבוה (HBM3e) (141-186 GB לכל GPU) כדי להתאים את משקלי המודל למספר קטן יותר של GPU, וכך לצמצם את התקורה של תקשורת בין-שבבית. סדרות מכונות מומלצות:

    • ‫A4X (NVIDIA GB200)
    • ‫A4 (NVIDIA B200)
    • ‫A3 Ultra (NVIDIA H200)
  • תפוקה גבוהה והצגה בזמן אמת: שאילתות אינטראקטיביות עם השהיה נמוכה, תשובות בסטרימינג ויצירת תמונות משתמשות בפורמטים מספריים כמותיים עם האצת חומרה, כמו נקודה צפה של 8 ביט (FP8), מספר שלם של 8 ביט (INT8) ומספר שלם של 4 ביט (INT4), כדי למקסם את תפוקת הבקשות לכל דולר. סדרת מכונות מומלצת:

    מידע נוסף זמין במאמרי העזרה של AI Hypercomputer, המלצות להכניס היקש לשימוש בסביבת הייצור.

גרפיקה ומחשוב חזותי

HPC וסימולציה

  • סימולציה ומודלים מדעיים: יישומים בדינמיקה מולקולרית (כמו GROMACS ו-AMBER), דינמיקה חישובית של נוזלים (CFD), כימיה קוונטית, אסטרופיזיקה ותחזית מזג אוויר דורשים ביצועים גבוהים של נקודה צפה (FP64) בדיוק כפול של 64 ביט ורוחב פס גבוה של הזיכרון. סדרת מכונות מומלצת:

    • ‫A4X (NVIDIA GB200)
    • ‫A4 (NVIDIA B200)
    • ‫A3 (NVIDIA H100)
    • ‫A2 (NVIDIA A100)

    מידע נוסף מופיע במאמר המלצות ל-HPC במסמכי התיעוד של AI Hypercomputer.

שיקולים לגבי עומסי עבודה

בדרך כלל, יחידות GPU לא מתאימות לעומסי העבודה הבאים:

  • לוגיקה עקבית וחד-חוטית: משימות שמתבססות על ענפי החלטה עקביים או על צינורות להרצה סדרתית פועלות טוב יותר במעבדים עם תדרי שעון גבוהים של ליבה אחת.
  • אפליקציות אינטרנט רגילות ומיקרו-שירותים: שרתי אינטרנט לשימוש כללי, מערכות לניהול מסדי נתונים רלציוניים (RDBMS) וקצה עורפי רגיל של API ללא דרישות של AI או עיבוד גרפי לא נהנים מהאצת GPU. עומסי העבודה האלה מתאימים יותר לאירוח חסכוני במקרים של מכונות וירטואליות עם מעבדי CPU לשימוש כללי או עם מעבדי CPU מותאמת לצריכת מעבד גבוהה (compute-optimized).
  • עומסי עבודה שעברו אופטימיזציה ל-XLA ולמסגרות של קומפילציה של גרפים: אם המודלים שלכם ללמידה עמוקה מבוססים על מסגרות כמו JAX,‏ PyTorch/XLA או TensorFlow, הם יכולים ליהנות מאופטימיזציות של גרפים מבוססות-קומפילציה (XLA). אם המודלים שלכם נהנים גם ממערכים סיסטוליים של מטריצות בהתאמה אישית וממיתוג מעגלים אופטיים, כדאי לשקול להעריך ארכיטקטורות חלופיות של מאיצים שמיועדות לפרדיגמות הביצוע הספציפיות האלה.

שיקולי תמחור

הגורמים הבאים קובעים את התמחור של GPU ב- Google Cloud:

  • דגם ה-GPU הספציפי.

  • מספר ה-GPU שנוספו.

  • משאבים שהוקצו, כמו vCPU, זיכרון מערכת ואחסון.

  • מודל הצריכה שבוחרים.

בקטעים הבאים מפורטים מודלי צריכה ואפשרויות הנחה שזמינים ל-GPU ב- Google Cloud.

מודלים של צריכה ורכישה

אתם יכולים להקצות מופעי GPU באמצעות כמה אפשרויות צריכה, בהתאם לדרישות הזמינות ולסבילות שלכם לעלויות:

  • ‫על פי דרישה: תמחור רגיל של תשלום לפי שימוש (PAYG) שמחויב לפי שנייה ללא התחייבות לטווח ארוך. מופעים על פי דרישה מציעים גמישות מלאה במחזור החיים של פיתוח, בדיקה ועומסי עבודה משתנים בייצור.

  • ‫VM במודל Spot: מכונות וירטואליות עם הנחה משמעותית (עד 60-91% הנחה מהתעריפים על פי דרישה) שמתבססות על קיבולתGoogle Cloud עודפת. מכיוון ש- Google Cloud יכול להפסיק או למחוק מכונות וירטואליות זמניות כדי לפנות קיבולת בהודעה של 30 שניות, מכונות המחשוב האלה מתאימות במיוחד לאימון של מודלים של למידת מכונה באצווה עם עמידות בפני תקלות, למשימות באצווה עם נקודות ביקורת ולעיבוד נתונים מבוזר.

  • Flex-start VMs: אפשרות תזמון דינמית שמבוססת על Dynamic Workload Scheduler ‏ (DWS). האפשרות הזו מספקת משאבי GPU בתוך תקופה מוגדרת לעומסי עבודה עם משך קבוע (עד 7 ימים) בתעריפים מוזלים.

  • הזמנות:

    • ‫Reservations: אתם יכולים להזמין קיבולת ל-GPU רגילים ולהשתמש בה באופן מיידי.
    • מקום שמור לעתיד (מצב יומן ו-AI Hypercomputer): אתם יכולים לבקש לשריין קיבולת של GPU באשכול לתאריך ולשעה עתידיים. אם Google Cloud יאשר את הבקשה, תוכלו להתחיל להשתמש בקיבולת בזמן שציינתם ולשמור על גישה בלעדית עד שההזמנה תסתיים.

אפשרויות הנחה

  • ‫Committed use discounts (CUDs): הנחות משמעותיות (עד 55% על התחייבויות ל-3 שנים או 37% על התחייבויות לשנה אחת) בתמורה להתחייבות לשמור על רמת שימוש רציפה במשאבים באזור מסוים. כדי לקבל הנחות CUD על סוגי מכונות שעברו אופטימיזציה להאצת ביצועים ועל יחידות GPU שמצורפות אליהן, צריך לרכוש התחייבויות לשימוש במשאבים שמצורפות להזמנות.

  • ‫הנחות על שימוש קבוע (SUDs): הנחות אוטומטיות שמוחלות על מכונות וירטואליות מסוג N1 ועל יחידות GPU שמצורפות אליהן, כשהן פועלות יותר מ-25% מחודש החיוב. סדרות מכונות שעברו אופטימיזציה לשימוש במאיצים (סדרות A ו-G) לא מקבלות SUD.

במחירון של יחידות GPU ובמחירון של מכונות VM אפשר לראות את המחירים המפורטים לשעה ולחודש בכל האזורים.

במאמר זמינות אפשרויות הצריכה לפי סוג מכונה מופיעה טבלה מפורטת של זמינות אפשרויות הצריכה בכל סוגי המכונות של המאיצים.

המאמרים הבאים