כדי להריץ עומסי עבודה של בינה מלאכותית (AI), למידת מכונה (ML) או מחשוב עתיר ביצועים (HPC), אתם יכולים לפרוס מכונות וירטואליות (VM) ואשכולות של Compute Engine שעברו אופטימיזציה ל-AI, ומשתמשות במכונות A4X, A4, A3 Ultra, A3 Mega ו-A3 High (עם 8 יחידות GPU). למידע נוסף על התכונות של המכונות האלה שמאפשרות להריץ אשכולות AI ו-ML בקנה מידה גדול, אפשר לעיין במאמר סקירה כללית על ניהול אשכולות.
אפשר ליצור ישירות מ-Compute Engine מכונות וירטואליות מסוג A4X, A4, A3 Ultra, A3 Mega ו-A3 High (עם 8 יחידות GPU), באמצעות שירותים מנוהלים כמו Google Kubernetes Engine (GKE), או באמצעות כלי פריסה כמו Cluster Toolkit.
כדי לבחור את האפשרות המתאימה ביותר ליצירת מכונות וירטואליות או אשכולות לתרחיש השימוש שלכם, צריך לבחור באחת מהאפשרויות הבאות:
| אפשרות | תרחיש לדוגמה |
|---|---|
| Cluster Director | אתם רוצים שירות מנוהל מלא שמבצע אוטומטית את ההגדרה של אשכולות Slurm. Cluster Director עוזר לכם להגדיר משאבי מחשוב, רשת ואחסון עבור האשכולות שלכם כדי למקסם את הביצועים ולמזער את זמן ההשבתה. מידע נוסף מופיע במאמר בנושא יצירת אשכול Slurm בניהול מלא לעומסי עבודה של AI. |
| Cluster Toolkit | אתם רוצים להשתמש בתוכנת קוד פתוח שתפשט את התהליך של פריסת אשכולות Slurm ו-GKE. הכלי Cluster Toolkit נועד להיות ניתן להתאמה אישית ולהרחבה. אתם יכולים להשתמש בתוכניות כדי להקצות משאבי רשת ואחסון. למידע נוסף, אפשר לעיין במאמרים הבאים: |
| GKE | אתם רוצים גמישות מקסימלית בהגדרת אשכול GKE בהתאם לצרכים של עומס העבודה. מידע נוסף זמין במאמרים הבאים: |
| שימוש ב-Compute Engine | אתם רוצים שליטה מלאה בשכבת התשתית כדי שתוכלו להגדיר כלי תזמור משלכם. מידע נוסף זמין במאמרים הבאים:
|
המאמרים הבאים
- מידע על התשתית שעברה אופטימיזציה לביצועים של AI Hypercomputer: