AI Hypercomputer הוא מערכת משולבת של מחשוב-על שעברה אופטימיזציה לתמיכה בעומסי עבודה של בינה מלאכותית (AI) ולמידת מכונה (ML). זוהי חבילה מאוחדת של תשתית AI של Google Cloud, והיא מספקת נקודת כניסה יחידה לבדיקה, להגדרה ולפריסה של חומרה שעברה אופטימיזציה לביצועים, תוכנה בקוד פתוח ומודלים גמישים של צריכה.
AI Hypercomputer משלב תכנון ברמת המערכת ושיטות מומלצות כדי לשפר את היעילות לאורך כל מחזור החיים של פיתוח ה-AI – החל מאב טיפוס ופיתוח, ועד לאימון בהיקף נרחב והצגה בזמן אמת.
ארכיטקטורת המערכת
AI Hypercomputer משלב את שלושת הרכיבים האלה באופן אנכי כדי למקסם את התפוקה – מדד הפרודוקטיביות בפועל של למידת מכונה:
- תשתית שעברה אופטימיזציה לביצועים: מספקת מאיצים (GPU של NVIDIA ו-TPU של Google Cloud ), משאבי רשת ואחסון.
- GPUs: מסווגים לפי האופן שבו המערכת מטפלת באירועים שקשורים למחזור החיים שלהם ולתחזוקה שלהם:
- GPU כללי: תשתית שמנוהלת כיחידות מחשוב עצמאיות עם תחזוקה אסינכרונית.
- יחידות GPU באשכולות: אשכולות עם ביצועים גבוהים שמנוהלים כמערכת אחת עם צימוד הדוק ותחזוקה מסונכרנת.
- TPU: שימוש בחומרה שנועדה לבצע פעולות מטריצה גדולות, וכוללת זיכרון ברוחב פס גבוה (HBM) על השבב למודלים גדולים יותר ולגדלים גדולים יותר של אצווה. אפשר לחבר יחידות TPU בקבוצות שנקראות פרוסות, כדי להרחיב את נפח העבודה בלי לבצע שינויים משמעותיים בקוד. מידע על תשתית TPU זמין במסמכי התיעוד של Cloud TPU.
- GPUs: מסווגים לפי האופן שבו המערכת מטפלת באירועים שקשורים למחזור החיים שלהם ולתחזוקה שלהם:
- תוכנה בקוד פתוח: מציעה גרסאות שעברו אופטימיזציה של מסגרות למידת מכונה (PyTorch, JAX ו-TensorFlow) ופלטפורמות לניהול תהליכים. כדי לפרוס את המאיצים ולנהל אותם, אפשר לבחור מבין האפשרויות הבאות:
- Google Kubernetes Engine להרחבת קנה מידה אוטומטית של קונטיינרים
- Slurm דרך Cluster Director
- Cluster Toolkit blueprints
- אפשרויות צריכה: מציעות אפשרויות גמישות להקצאת משאבים בהתאם לצרכים של עומס העבודה:
- מכונות וירטואליות עם הפעלה גמישה, מכונות וירטואליות מסוג Spot והזמנות: מספקות אפשרויות גמישות לעומסי עבודה שונים.
- Dynamic Workload Scheduler: מספק הקצאת משאבים אטומית לבלוקים שלמים של צמתים מחוברים לצורך אימון בקנה מידה גדול.
יתרונות
- ביצועים גבוהים וקצב העברת נתונים טוב: אופטימיזציה של שכבות התזמון והזמן הפעולה כדי למקסם את קצב העברת הנתונים הטוב, כך שמאיצי הביצועים יקדישו יותר זמן לחישובים פרודוקטיביים ופחות זמן לתקורה של המערכת.
- אמינות משולבת: גישה לתכונות אמינות מיוחדות:
- GPU באשכולות: כולל מעקב אוטומטי אחרי תקינות החומרה והחלפה יזומה של צמתים.
- מעבדים גרפיים כלליים: משתמשים בGoogle Cloud תיקון אוטומטי של צמתים כדי לשמור על זמן פעולה רציפה ברמת ה-Pod עבור ציוד שרתים.
- אחסון אופטימלי: שימוש בשירותי אחסון עם תפוקה גבוהה, כמו Google Cloud Managed Lustre ו-Cloud Storage Rapid, כדי למנוע צווארי בקבוק של קלט/פלט.
תרחישים לדוגמה
AI Hypercomputer עונה על הצרכים של תרחישי השימוש הבאים:
| תרחיש שימוש | דוגמאות לעומסי עבודה |
|---|---|
| עומסי עבודה (workloads) של AI ו-ML בקנה מידה גדול |
|
| הסקת מסקנות ופרסום מודלים |
|
| יצירת אב טיפוס ופיתוח |
|
המאמרים הבאים
- מידע על התשתית שעברה אופטימיזציה לביצועים של AI Hypercomputer:
- מודלים של צריכה
- מידע נוסף על ניהול אשכולות