הסברים על המונחים

התנאים הבאים חלים על AI Hypercomputer.

מאיץ
מכשיר חומרה ייעודי, כמו GPU או TPU, שנועד לבצע משימות ספציפיות, כמו עומסי עבודה של למידת מכונה, בצורה יעילה יותר ממעבד לשימוש כללי.

חסימה של
אוסף של בלוקים משנה שמחוברים ביניהם. בתוך בלוק, אפשר להגיע לכל GPU דרך רשת ה-fabric, וכך להבטיח תקשורת עם השהיה נמוכה במיוחד למשימות אימון מבוזרות.

אשכול
אוסף של בלוקים מחוברים שמחוברים באמצעות רשת מהירה. הארכיטקטורה של רשת east-to-west שאינה חוסמת מאפשרת להרחיב משימות אימון גדולות לאלפי מעבדי GPU בלי להיתקל בצווארי בקבוק בביצועים או ברוחב הפס.

GPU באשכול
קטגוריה של משפחות מכונות ל-GPU, כולל A4X,‏ A4,‏ A3 Ultra,‏ A3 Mega ו-A3 High (8 GPUs). מעבדי GPU מקובצים מאפשרים לצוותים לפרוס אלפי מאיצים מקושרים ולשנות את קנה המידה שלהם כמערכת יחידה ומקושרת היטב, באמצעות רשתות מיוחדות ותחזוקה מסונכרנת. הן מתאימות במיוחד לעומסי עבודה שדורשים מחשוב קיצוני, זיכרון וסנכרון מהיר של רשתות. תרחישי שימוש נפוצים כוללים אימון מוקדם של מודלים בסיסיים עם טריליוני פרמטרים, הפעלת מודלים מתקדמים וסימולציות לגילוי תרופות.

תחזוקה דחופה
נקרא לפעמים תחזוקת חירום. אירוע תחזוקה לא מתוכנן שנגרם בגלל בעיה קריטית בחומרה, בתוכנה או באבטחה. במקרים של סוגי מכונות מאיצות נתמכות, תחזוקה דחופה מספקת התראה מראש במקום שיבוש מיידי. ההתראה הזו מאפשרת לכם לרוקן את עומסי העבודה בצורה מסודרת, ואם תרצו, להפעיל את התיקון לפני שהמערכת תסיים את פעולת המכונות הווירטואליות.

מעבד גרפי כללי
קטגוריה של משפחות מכונות עם GPU, כולל G2,‏ G4,‏ A2,‏ N1+T4 ו-A3 Edge. יחידות GPU כלליות מאפשרות לצוותים לפרוס ולהרחיב מאיצי NVIDIA עם אוטונומיה תפעולית מלאה, בלי להסתבך עם המורכבות הארכיטקטונית של אשכולות מתואמים של מחשבי-על. הם אידיאליים לעומסי עבודה שבהם יש עדיפות לזמינות גבוהה, להקצאת משאבים בשירות עצמי ולהרחבה עצמאית. תרחישים נפוצים לדוגמה: הסקת מסקנות בזמן אמת, RAG, יצירת אב טיפוס ואימון מודלים קטנים עד בינוניים.

רשת
תשתית רשת מספקת קישוריות עם רוחב פס גבוה וזמן אחזור נמוך בכל הבלוקים והשירותים באשכול. Google Cloud ‫Jupiter היא ארכיטקטורת רשת של מרכזי נתונים של Google שמשתמשת ברשת מוגדרת באמצעות תוכנה ובמתגי מעגלים אופטיים כדי לפתח את הרשת ולבצע אופטימיזציה של הביצועים שלה.

צומת או מארח
מכונת שרת פיזית אחת במרכז הנתונים. לכל מארח משויכים משאבי מחשוב, כמו מאיצים. המספר וההגדרה של משאבי המחשוב האלה תלויים במשפחת המכונות. מכונות של Compute Engine מוקצות על גבי מארח פיזי.

דומיין NVLink, שנקרא גם תת-בלוק, הוא יחידת הקיבולת הבסיסית למכונות A4X Max ו-A4X. דומיין NVLink מורכב מ-18 מכונות מסוג A4X Max או A4X ‏ (72 יחידות GPU) שמחוברות באמצעות מערכת NVLink מרובת צמתים.

תת-בלוק
קבוצה של מארחים וציוד קישוריות משויך שנמצאים במתלה פיזי אחד. בהקשר של מכונות A4X Max ו-A4X, בלוק משנה נקרא גם דומיין NVLink.

סופרבלוק
קבוצה פיזית של מכונות שמחוברות זו לזו בתוך מרכזי נתונים. הצבת מכונות בתוך בלוק על מאפשרת להשיג את קצב העברת הנתונים הגבוה ברשת ואת זמן האחזור של פחות מאלפית השנייה שנדרשים להרצת עומסי עבודה של אימון עם צימוד הדוק.

מידע נוסף

במסמכים הבאים מוסבר על המינוחים שרלוונטיים לנושאים המתאימים: