שירותי רשת לפריסות

שירותי הרשת שאתם מגדירים תלויים באפשרות הפריסה שבחרתם (מכונות וירטואליות או אשכולות) ובתשתית.

המסמך הזה מיועד לאדריכלים, למהנדסי רשת ולמפתחים שרוצים להבין את שירותי הרשת עבור פריסות של AI Hypercomputer. ההנחה במסמך הזה היא שיש לכם היכרות בסיסית עם מושגים של רישות בענן ומחשוב מבוזר. מידע נוסף על אפשרויות הפריסה זמין במאמר סקירה כללית של אפשרויות הפריסה.

מידע מפורט על ארכיטקטורת רשת, פרוטוקולים וטופולוגיות של חומרה זמין במאמר סקירה כללית על רשתות GPU.

רישות לפריסות GKE שעברו אופטימיזציה ל-AI עם הגדרות ברירת מחדל

כשיוצרים אשכול GKE שעבר אופטימיזציה ל-AI עם הגדרות ברירת מחדל, תוכנית ה-Cluster Toolkit מגדירה את הרשת באופן הבא:

  • התוכנית משתמשת ברשת VPC שמוגדרת כברירת מחדל עבור אשכול GKE הראשי.
  • הוא יוצר שני VPC נוספים: אחד לכרטיס ממשק רשת (NIC) שני של המארח, ואחד לתנועה של גישה ישירה לזיכרון (RDMA) מרחוק מ-GPU ל-GPU.
  • תוכנית ה-blueprint מחילה פרופיל רשת מוגדר מראש שמנוהל על ידי Google על ה-VPC שמשמש לתעבורת GPU. הפרופיל הזה מגדיר באופן אוטומטי את הרשת לביצועי RDMA במהירות גבוהה ועם השהיה נמוכה.
  • תוכנית האב יוצרת באופן אוטומטי שמונה רשתות משנה ייעודיות ב-RDMA VPC, אחת לכל כרטיס רשת RDMA במכונת מאיץ וירטואלית.
  • הוא מגדיר כללים של חומת אש שמאפשרים את כל תעבורת ה-TCP,‏ UDP ו-ICMP בין הצמתים באשכול.

רשתות לפריסות GKE עם הגדרה בהתאמה אישית

הגדרת הרשת בהגדרות GKE בהתאמה אישית תלויה בסוג עומס העבודה ובסוג התשתית:

  • עבור מעבדים גרפיים כלליים או עומסי עבודה לא מבוזרים, יוצרים אשכול GKE ללא GPUDirect RDMA. בהגדרה הזו נעשה שימוש ברשת VPC אחת לכל התקשורת.
  • כדי להשתמש ב-GPU באשכול או בעומסי עבודה מבוזרים, צריך ליצור אשכול GKE עם GPUDirect RDMA מופעל. ההגדרה הזו משתמשת בסביבת VPC מרובה שמפרידה בין תעבורה למטרות כלליות לבין תקשורת ברוחב פס גבוה בין GPU ל-GPU.

רשתות לפריסות של אשכולות Slurm

אפשר להשתמש ב-Cluster Toolkit כדי לפרוס עומסי עבודה של AI ו-ML באמצעות תוכניות מותאמות אישית, למשל עבור סדרות A4 או A3 Ultra.

הרכיבים ברשת שהוגדרו על ידי התוכנית לפריסות של Slurm עם GPU באשכול הם:

  • תוכנית ה-blueprint יוצרת שלוש רשתות VPC נפרדות: רשת VPC ראשית למישור הבקרה של Slurm, רשת VPC משנית לתנועה כללית ברמת המארח ורשת VPC ייעודית עם ביצועים גבוהים לתקשורת בין יחידות GPU.
  • במישור הנתונים של ה-GPU, התוכנית משתמשת בפרופיל רשת מנוהל על ידי Google שהוגדר מראש ועבר אופטימיזציה ל-RoCE.
  • תוכנית האב מגדירה טווח כתובות IP ייעודי שנדרש על ידי שירות Filestore, שמספק את ספריית /home המשותפת לאשכול.
  • הוא יוצר VPC זמני ומבודד לבניית אימג' שמשמש רק במהלך תהליך בניית האימג' של מכונה וירטואלית בהתאמה אישית לצמתי האשכול.

רשתות למכונות Compute Engine

אתם יכולים להשתמש ב-Compute Engine כדי ליצור מכונות וירטואליות עצמאיות, מופעי מחשוב בכמות גדולה וקבוצות של מופעי מכונה מנוהלים (MIG). הדרישות הספציפיות של הרשת תלויות במודל התשתית של סוג המכונה:

  • GPU באשכולות: סדרות המכונות האלה (A4X Max,‏ A4X,‏ A4,‏ A3 Ultra,‏ A3 Mega ו-A3 High עם 8 מעבדי GPU) דורשות הגדרת רשת מרובת VPC כדי להפריד בין תעבורה כללית ממארח למארח לבין תקשורת בין מעבדי GPU עם רוחב פס גבוה.
  • מעבדי GPU כלליים: סדרות המכונות האלה (G2,‏ G4,‏ A2 ו-N1 עם T4 או V100) משתמשות בארכיטקטורת VPC יחידה דרך ממשקי gVNIC לכל התקשורת. ‫A3 Edge הוא חריג שדורש ארבעה רשתות VPC של נתונים ו-GPUDirect-TCPX.

מידע מפורט על כרטיסי הרשת והגדרת הרשת של סוג המכונה שלכם זמין במאמר Networking and GPU machines.

המאמרים הבאים