סקירה כללית של אשכולות אימון ב-Gemini Enterprise Agent Platform

אם אתם מעוניינים באשכולות אימון של Gemini Enterprise Agent Platform, אתם יכולים לפנות לנציג המכירות שלכם כדי לקבל גישה.

‫Gemini Enterprise Agent Platform training clusters הוא שירות של Google Cloud שמיועד לפשט ולהאיץ את עומסי העבודה הגדולים והמורכבים ביותר של AI/ML. הוא נועד במיוחד לפתור בעיות בהדרכה בקנה מידה גדול, כמו הגדרה מורכבת של אשכולות, אופטימיזציה של מסגרות, טיפול בכשלים בחומרה ושילוב של ערכות כלים שונות.

הצעת הערך והתכונות העיקריות

לשימוש באשכולות אימון של Gemini Enterprise Agent Platform יש כמה יתרונות מרכזיים:

  • חוויית משתמש של Slurm בקוד פתוח ושקיפות של האשכול: אשכולות האימון של Gemini Enterprise Agent Platform מספקים כלים מוכרים וגמישים להפעלת משימות ולניהול שלהן באמצעות חוויית משתמש של Slurm בקוד פתוח. ‫Slurm הוא תקן בתעשייה שמוכר בזכות אופטימיזציה של תזמון GPU, סבילות לתקלות אוטומטית והשקה פשוטה של עבודות מקבילות.

  • הגדרה וקביעת תצורה אוטומטיות של אשכולות: אשכולות האימון של Gemini Enterprise Agent Platform מבצעים אוטומציה של ההגדרה וקביעת התצורה של אשכולות, במטרה לעבור משלב ההזמנה לשלב האימון בייצור תוך שעות. משתמשים יכולים ליצור אשכולות באמצעות Google Cloud המסוף (באמצעות ארכיטקטורות הפניה או הגדרה שלב אחר שלב) או באמצעות קריאות ל-API עם קובצי JSON.

  • מתכונים וזרימות עבודה מוגדרים מראש למדעי הנתונים: אשכולות האימון של Gemini Enterprise Agent Platform כוללים כלים ייעודיים ומתכוני אימון אופטימליים כדי להתחיל לאמן מודלים פופולריים כמו Llama ו-Gemma, כולל אימון מוקדם, SFT (שיפור בהדרכה) ואימון חיזוק (RL). המתכונים האלה מוגדרים מראש לביצועים מתקדמים (SOTA) בתשתית, ומדגימים שיפורים משמעותיים בביצועים. Google Cloud

  • עמידות החומרה וזמן פעולה רציף גבוה: אשכולות האימון של Gemini Enterprise Agent Platform מתוכננים עם עמידות החומרה כדי לשפר את זמן הפעולה הרציף של האשכול. הוא פותר אוטומטית בעיות בחומרה, מזהה וממיין מצבי כשל שונים (לדוגמה, בדיקות נכונות, בדיקות מהירות, שגיאות של קוד לתיקון שגיאות (ECC), בדיקות של NVIDIA Data Center GPU Manager ‏ (DCGM), קיבולת של נפח אחסון בדיסק) ומפעיל פעולות לתיקון בעיות כמו הפעלה מחדש, יצירת תמונה מחדש או החלפה של צמתים פגומים, והמשך הפעולה מנקודות ביקורת. כך אפשר לצמצם את העלייה המשמעותית בעלויות ואת העיכובים שנגרמים כתוצאה מהפסקות בעבודה ומכשלים בחומרה במהלך אימון בקנה מידה גדול.

  • ארכיטקטורה ורכיבים: אשכולות האימון של Gemini Enterprise Agent Platform פועלים בתשתית Compute Engine שתומכת במעבדי GPU ובמעבדי CPU. הוא משתמש ב-Slurm Orchestrator מנוהל לפריסה ולניהול של צמתים לחישוב, כולל צמתים לכניסה וצמתים של עובדים. השירות משולב עם שירותים אחרים של Google Cloud , כמו רשת ואחסון.

  • MLOps ו-Observability: שילוב עם כלי Vertex ML Ops כמו מרשם המודלים של Gemini Enterprise Agent Platform לרישום, מעקב וניהול גרסאות אוטומטיים של תהליכי עבודה שאומנו, ו-Vertex AI Inference לפריסה עם שינוי גודל אוטומטי ומדדים אוטומטיים. בנוסף, אשכולות האימון כוללים שילוב אוטומטי של יכולות ניטור עם Vertex AI TensorBoard, כדי להמחיש את תהליכי האימון, לעקוב אחרי מדדים ולזהות בעיות בשלב מוקדם.

אפשר ליצור, לאחזר, לרשום, לעדכן ולמחוק אשכולות אימון באמצעות Gemini Enterprise Agent Platform training clusters API. אחרי יצירת האשכול, המשתמשים יכולים להתחבר לצמתים, להריץ פקודות Slurm בסיסיות (לדוגמה, sinfo,‏ sbatch) ולהריץ עומסי עבודה שקשורים ל-GPU (לדוגמה, nvidia-smi) כדי לוודא שהפונקציונליות שלו תקינה. באמצעות Slurm Job API אפשר לנהל משימות Slurm ישירות דרך Agent Platform API.

‫Gemini Enterprise Agent Platform training clusters מספקת API להפעלת משימות של מודלים גדולים של שפה (LLM) שנוצרו מראש באמצעות מתכונים מותאמים למודלים כמו Llama ו-Gemma, עם תמיכה באימון מראש ובאימון מראש רציף מנקודות ביקורת. אפשר לעקוב אחרי משימות על ידי התחברות לצומת הכניסה ובדיקת קובצי הפלט ופקודות Slurm כמו squeue.

הסברים על המונחים

בקטע הזה מוגדרים מונחים ומושגים מרכזיים שחשובים להבנה ולשימוש יעיל באשכולות אימון של Gemini Enterprise Agent Platform. המונחים האלה כוללים רכיבי שירות ליבה, שיקולים ארכיטקטוניים, טכנולוגיות אחסון משולבות ומושגים בסיסיים של למידת מכונה (ML) ו-MLOps שמהווים את הבסיס לסביבת האימון.

מושגים מרכזיים בשירותי ליבה

node
  • מכונה וירטואלית אחת (מכונה ב-Compute Engine) באשכול. בהקשר של אימון מנוהל באשכולות שמורים, צומת מתייחס למכונה וירטואלית (VM) ספציפית שמשמשת כיחידת חישוב יחידה באשכול. אפשר לחשוב על זה כאחת ממכונות ה-worker הייעודיות שמריצות חלק ממשימת האימון הכוללת. כל צומת מצויד במשאבים ספציפיים כמו CPU, זיכרון ומאיצים (לדוגמה, GPU מסוג A3 או A4), וכולם פועלים יחד בצורה מתואמת כדי לטפל במשימות אימון מבוזרות בקנה מידה גדול.
login node
  • צומת התחברות הוא נקודת הכניסה הראשית של משתמש כדי לגשת לאשכול, לשלוח עבודות ולנהל קבצים. מידע נוסף זמין במאמר מה זה מחשוב עתיר ביצועים?
partition
  • ב-Slurm, קבוצה לוגית של צמתים, שמשמשת לעיתים קרובות להפרדה בין צמתים עם הגדרות חומרה שונות.
מתכון
  • בהקשר של Managed Training, מתכון הוא חבילה מקיפה וניתנת לשימוש חוזר שמכילה את כל מה שצריך כדי להפעיל עומס עבודה ספציפי של אימון בקנה מידה גדול.
Slurm cluster
  • אוסף של מכונות ב-Compute Engine שמנוהלות על ידי Slurm, שכולל צומת כניסה ומספר צמתים של עובדים שהוגדרו להרצת משימות אימון. מידע נוסף זמין במאמר הכלי לניהול עומסי עבודה Slurm.
צומת עובד
  • צומת עובד הוא מכונה או מופע חישובי בתוך אשכול, שאחראי להפעלת משימות או לביצוע עבודה. במערכות כמו אשכולות Kubernetes או Ray, הצמתים הם יחידות המחשוב הבסיסיות. מידע נוסף זמין במאמר מהו מחשוב עתיר ביצועים (HPC)?

ארכיטקטורה ורשתות

רשת VPC של צרכן
  • רשת VPC של צרכן היא ענן וירטואלי פרטי (VPC) ב-Google Cloud שמקבל גישה פרטית לשירות שמארח בענן וירטואלי פרטי אחר (שנקרא VPC של יצרן). מידע נוסף זמין במאמר Private Service Connect.
יחידת שידור מקסימלית (MTU)
  • הגודל המקסימלי של מנת נתונים שמכשיר שמחובר לרשת יכול לשדר. גדלים גדולים יותר של MTU (מסגרות ג'מבו) יכולים לשפר את ביצועי הרשת עבור עומסי עבודה מסוימים. מידע נוסף זמין במאמר בנושא יחידת שידור מקסימלית.
גישה לשירותים פרטיים
  • גישה לשירותים פרטיים היא חיבור פרטי בין הרשת של הענן הווירטואלי הפרטי (VPC) שלכם לבין רשתות בבעלות Google או ספקי שירותים של צד שלישי. היא מאפשרת למכונות וירטואליות (VM) ברשת ה-VPC שלכם לתקשר עם השירותים האלה באמצעות כתובות IP פנימיות, וכך להימנע מחשיפה לאינטרנט הציבורי. מידע נוסף זמין במאמר גישה לשירותים פרטיים.
קישור בין רשתות VPC שכנות (peering)
  • חיבור רשת שמאפשר לשתי רשתות VPC לתקשר באופן פרטי. בהקשר של Managed Training באשכולות שמורים, VPC Network Peering הוא רכיב קריטי לשילוב שירותים חיוניים. לדוגמה, זו השיטה הנדרשת לחיבור ה-VPC של האשכול למופע Filestore, שמספק את ספריית ה-‎/home המשותפת הנדרשת לכל הצמתים באשכול.
zone
  • אזור פריסה ספציפי בתוך אזור Google Cloud. בהקשר של Managed Training באשכולות שמורים, כדי לקבל את הביצועים הכי טובים, צריך ליצור את כל הרכיבים של השירות (האשכול, Filestore והמכונות ב-Managed Lustre) באותו אזור.

טכנולוגיות אחסון משולבות

Cloud Storage Fuse
  • מתאם FUSE בקוד פתוח שמאפשר לטעון קטגוריות של Cloud Storage כמערכת קבצים במערכות Linux או macOS. מידע נוסף מופיע במאמר בנושא Cloud Storage Fuse.
Filestore
  • שירות אחסון קבצים מנוהל לחלוטין עם רמת ביצועים גבוהה מבית Google Cloud, שמשמש לעיתים קרובות לאפליקציות שנדרשת בהן מערכת קבצים משותפת. מידע נוסף מופיע במאמר סקירה כללית על Filestore.
Managed Lustre
  • מערכת קבצים מקבילית ומבוזרת שמיועדת למחשוב עתיר ביצועים. ‫Managed Lustre של Google Cloud מספק מערכת קבצים עם תפוקה גבוהה לעומסי עבודה תובעניים. מידע נוסף מופיע במאמר סקירה כללית על Managed Lustre.
שכבת ביצועים
  • הגדרת תצורה של מופע Managed Lustre שמגדירה את מהירות התפוקה שלו (ב-MBps לכל TiB) ומשפיעה על הקיבולת המינימלית והמקסימלית שלו.

מושגים מרכזיים ב-ML וב-MLOps

נקודת ביקורת
  • נתונים שמתעדים את מצב הפרמטרים של המודל במהלך האימון או אחרי שהאימון מסתיים. לדוגמה, במהלך האימון, אפשר: 1. להפסיק את האימון, אולי בכוונה או אולי כתוצאה משגיאות מסוימות. 2. מצלמים את נקודת הביקורת. 3. בשלב מאוחר יותר, טוענים מחדש את נקודת הבדיקה, אולי בחומרה אחרת. 4. להתחיל מחדש את ההדרכה. ב-Gemini, נקודת ביקורת מתייחסת לגרסה ספציפית של מודל Gemini שאומנה על מערך נתונים ספציפי.
כוונון עדין מפוקח (SFT)
  • טכניקה של למידת מכונה שבה מודל שאומן מראש עובר אימון נוסף על מערך נתונים קטן יותר ומתויג, כדי להתאים אותו למשימה ספציפית.
Vertex AI Inference
  • שירות של Vertex AI שמאפשר להשתמש במודל מאומן של למידת מכונה (ML) כדי להסיק מסקנות מנתונים חדשים שלא נראו קודם. ‫Vertex AI מספק שירותים לפריסת מודלים לצורך הסקת מסקנות. מידע נוסף זמין במאמר קבלת מסקנות ממודל שאומן בהתאמה אישית.
מרשם המודלים של Vertex AI
  • מרשם המודלים של Vertex AI הוא מאגר מרכזי שבו אפשר לנהל את מחזור החיים של מודלים של למידת מכונה. במרשם המודלים של Vertex AI, תוכלו לראות סקירה כללית של המודלים שלכם כדי לארגן אותם טוב יותר, לעקוב אחריהם ולאמן גרסאות חדשות. אם יש לכם גרסת מודל שאתם רוצים לפרוס, אתם יכולים להקצות אותה לנקודת קצה ישירות מהמאגר, או לפרוס מודלים לנקודת קצה באמצעות שמות חלופיים. מידע נוסף זמין במאמר מבוא למרשם המודלים של Vertex AI.
Vertex AI TensorBoard
  • ‫Vertex AI TensorBoard הוא שירות מנוהל וניתן להרחבה ב-Google Cloud, שמאפשר למדעני נתונים ולמהנדסי ML להמחיש את הניסויים שלהם בלמידת מכונה, לנפות באגים באימון המודל ולעקוב אחרי מדדי הביצועים באמצעות הממשק המוכר של TensorBoard בקוד פתוח. הוא משתלב בצורה חלקה עם Vertex AI Training ושירותים אחרים, מספק אחסון מתמיד לנתוני ניסויים ומאפשר ניתוח שיתופי של פיתוח מודלים. מידע נוסף זמין במאמר מבוא ל-Vertex AI TensorBoard.