תזמור של AI/ML ב-GKE

Google Kubernetes Engine‏ (GKE) מספק פלטפורמה מאוחדת אחת לתזמור של כל מחזור החיים של פרויקטים של AI/ML. הוא מעניק לכם את העוצמה והגמישות שמאפשרות לכם לשפר את האימון, ההסקה ועומסי העבודה של הסוכנים הדיגיטליים, כך שתוכלו לייעל את התשתית ולהתחיל להשיג תוצאות. יכולות האורקסטרציה המתקדמות ביותר (SOTA) של GKE מספקות את היתרונות הבאים:

  • שיפור המהירות באמצעות החומרה: גישה למעבדי GPU ו-TPU חזקים וניהול שלהם, לצורך אימון והסקת מסקנות, בהיקף נרחב.
  • גמישות בשימוש בטכנולוגיות שונות: אפשר לשלב עם מסגרות מחשוב מבוזר, עיבוד נתונים והצגת מודלים שאתם כבר מכירים וסומכים עליהן.
  • פשטות של Kubernetes מנוהל: אתם מקבלים את כל היתרונות של פלטפורמה מנוהלת לאוטומציה, להרחבה ולשיפור האבטחה של כל מחזור החיים של AI/ML, תוך שמירה על גמישות.

כדאי לעיין בבלוגים, במדריכים ובשיטות המומלצות שלנו כדי ללמוד איך GKE יכול לעזור לכם לייעל את עומסי העבודה של AI/ML. מידע נוסף על היתרונות והתכונות הזמינות מופיע במאמר מבוא לשימוש בעומסי עבודה של AI/ML ב-GKE.

  • פיתוח באמצעות המודלים והכלים הכי עדכניים של AI גנרטיבי
  • שימוש בחינם ביותר מ-20 מוצרים פופולריים, כולל Compute Engine וממשקי API של AI
  • בלי חיובים אוטומטיים ובלי התחייבות

מוזמנים להתנסות ביותר מ-20 מוצרים חינמיים

אתם יכולים להשתמש ביותר מ-20 מוצרים בחינם לתרחישי שימוש נפוצים, כולל ממשקי API של AI, מכונות וירטואליות, מחסני נתונים (data warehouse) ועוד.

מאמרי עזרה

כאן תוכלו למצוא מדריכים למתחילים ומדריכים נוספים, לעיין בחומרי עזר חשובים ולקבל עזרה לפתרון בעיות נפוצות.
כדי להבין איך משתמשים בפועל בשירותי Google Cloud ומחברים ביניהם, אתם יכולים להיעזר בהדרכות בקצב אישי, בתרחישי שימוש, בארכיטקטורות לדוגמה ובדוגמאות קודים.
הדרכה
הדרכות ומדריכים

במאמר הזה מוסבר איך להשתמש ב-Cloud Storage FUSE כדי לשפר את הביצועים של עומסי עבודה של AI ו-ML ב-GKE.

הסקת מסקנות מ-AI/ML אימון AI/ML אחסון

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך להשתמש ב-Managed Lustre כדי לשפר את הביצועים של עומסי עבודה של AI ו-ML ב-GKE.

הסקת מסקנות מ-AI/ML אימון AI/ML אחסון

הדרכה
הדרכות ומדריכים

במאמר הזה מוסבר איך להתקין ולהריץ את בקר ארגז החול של הסוכן ב-GKE, ואיך לפרוס בסביבת ארגז חול באשכול כדי לבדוק פקודות shell לא מהימנות.

מדריך Agent Sandbox AI אקטיבי

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך להשתמש ב-Kata Containers בקוד פתוח עם ארגז החול לסוכנים ב-GKE כדי לבודד הרצת קוד לא מהימן.

הדרכה מדריך AI אקטיבי ארגז חול של סוכן AI

הדרכה
הדרכות ומדריכים

בקורס הזה תלמדו איך לפרוס ולנהל אפליקציית AI אקטיבי בקונטיינרים ב-GKE, באמצעות הערכה לפיתוח סוכנים (ADK) ו-vLLM להיקש שניתן להרחבה עם Llama 3.1.

מדריך היקש AI/ML AI אקטיבי

הדרכה
הדרכות ומדריכים

בקורס הזה תלמדו איך לפרוס ולנהל אפליקציית AI אקטיבי בקונטיינרים ב-GKE, באמצעות הערכה לפיתוח סוכנים (ADK) ו-Agent Platform להסקת מסקנות שניתנת להתאמה באמצעות Gemini 2.0 Flash.

מדריך היקש AI/ML AI אקטיבי

הדרכה
הדרכות ומדריכים

במאמר הזה מוסבר איך לפרוס מודלים גדולים של שפה (LLM) באמצעות יחידות לעיבוד טנסורים (TPU) ב-GKE עם מסגרת Optimum TPU serving של Hugging Face.

הדרכה הסקת מסקנות של AI/ML TPU

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך לבצע אופטימיזציה של עלויות עבור עומסי עבודה (workloads) של מודלים גדולים של שפה (LLM) ב-GKE באמצעות DWS Flex-start.

הוזלת עלויות GPU DWS

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך להכניס לשימוש בסביבת הייצור מודלים גדולים של שפה (LLM) באמצעות KubeRay ב-TPU, ואיך זה יכול לעזור לשפר את הביצועים של המודלים.

סרטון Ray TPUs

הדרכה
הדרכות ומדריכים

בקורס תלמדו איך לפשט ולהאיץ את הטעינה של משקלים של מודלים של AI/ML ב-GKE באמצעות Hyperdisk ML.

מדריך טעינת נתונים של AI/ML

הדרכה
הדרכות ומדריכים

איך להכניס לשימוש בסביבת הייצור מודל LLM באמצעות יחידות לעיבוד טנסורים (TPU) ב-GKE עם JetStream דרך PyTorch.

הדרכה הסקת מסקנות ב-AI/ML TPU

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר על שיטות מומלצות לאופטימיזציה של ביצועי היקש של LLM באמצעות יחידות GPU ב-GKE, בעזרת מסגרות ההגשה vLLM ו-Text Generation Inference ‏ (TGI).

הדרכה הסקת מסקנות מ-AI/ML מעבדי GPU

הדרכה
הדרכות ומדריכים

כאן מוסבר מתי כדאי להשתמש באופרטור NVIDIA GPU ואיך להפעיל אותו ב-GKE.

מדריך יחידות GPU

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך להגדיר את התשתית שלכם להרחבה אוטומטית באמצעות GKE Horizontal Pod Autoscaler ‏ (HPA) כדי לפרוס את Gemma LLM באמצעות JetStream במארח יחיד.

מדריך TPU

הדרכה
הדרכות ומדריכים

במאמר הזה מוסבר איך לבצע כוונון עדין של מודל שפה גדול (LLM) של Gemma באמצעות יחידות GPU ב-GKE עם ספריית הטרנספורמרים של Hugging Face.

הדרכה הסקת מסקנות מ-AI/ML מעבדי GPU

הדרכה
הדרכות ומדריכים

בקורס הזה תלמדו איך לפרוס מודל דיפוזיה יציבה ב-GKE ולהכניס אותו לשימוש בסביבת הייצור באמצעות TPU,‏ Ray Serve ותוסף Ray Operator.

Tutorial AI/ML Inference Ray TPUs

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך להגדיר את תשתית הגידול האוטומטי (autoscaling) באמצעות GKE Horizontal Pod Autoscaler ‏(HPA) כדי לפרוס את Gemma LLM עם מסגרת ההגשה Hugging Face Text Generation Interface ‏(TGI).

מדריך יחידות GPU

הדרכה
הדרכות ומדריכים

איך מריצים עומס עבודה של Megatron-LM PyTorch מבוסס-קונטיינר ב-A3 Mega.

הדרכה אימון AI/ML מעבדי GPU

הדרכה
הדרכות ומדריכים

איך מבקשים שיפור מהירות באמצעות חומרה (GPUs) בעומסי עבודה ב-GKE Autopilot.

מדריך יחידות GPU

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך להכניס לשימוש בסביבת הייצור את Llama 2 70B או Falcon 40B באמצעות כמה יחידות GPU של NVIDIA L4 עם GKE.

הדרכה הסקת מסקנות מ-AI/ML מעבדי GPU

הדרכה
הדרכות ומדריכים

כאן מוסבר איך להתחיל להשתמש ב-Ray ב-GKE בקלות על ידי הפעלת עומס עבודה באשכול Ray.

מדריך Ray

הדרכה
הדרכות ומדריכים

איך מפעילים את Falcon 7b,‏ Llama2 7b,‏ Falcon 40b או Llama2 70b באמצעות מסגרת Ray ב-GKE.

הדרכה הסקת מסקנות מ-AI/ML Ray מעבדים גרפיים

הדרכה
הדרכות ומדריכים

במאמר הזה נסביר איך לתזמר עומס עבודה של Jax בכמה פרוסות TPU ב-GKE באמצעות JobSet ו-Kueue.

מדריך TPU

הדרכה
הדרכות ומדריכים

איך עוקבים אחרי עומסי עבודה של GPU ב-GKE באמצעות NVIDIA Data Center GPU Manager‏ (DCGM).

מדריך יכולת צפייה ב-AI/ML מעבדי GPU

הדרכה
הדרכות ומדריכים

במדריך למתחילים הזה מוסבר איך לפרוס מודל אימון עם מעבדי GPU ב-GKE ולאחסן את התחזיות ב-Cloud Storage.

הדרכה אימון AI/ML מעבדי GPU

הדרכה
הדרכות ומדריכים

בסרטון הזה נסביר איך GKE עוזר לפתור אתגרים נפוצים באימון מודלים גדולים של AI בהיקף נרחב, ומהן השיטות המומלצות לאימון מודלים של למידת מכונה בהיקף נרחב ב-GKE ולהצגתם.

וידאו אימון AI/ML הסקת מסקנות מ-AI/ML

הדרכה
הדרכות ומדריכים

בפוסט הזה בבלוג מוסבר איך ליצור, להריץ ולבטל notebook של Jupiter עם Tensorflow.

בלוג AI/ML Training AI ML Inference GPUs

הדרכה
הדרכות ומדריכים

במדריך הזה נשתמש ב-Kueue כדי להסביר איך להטמיע מערכת להוספת משימות לתור, ואיך להגדיר שיתוף של משאבי עומס עבודה ומכסות בין מרחבי שמות שונים ב-GKE.

מדריך AI/ML Batch

הדרכה
הדרכות ומדריכים

במדריך הזה נסביר איך לשלב אפליקציה של מודל שפה גדול (LLM) שמבוססת על יצירה משולבת-אחזור (RAG) עם קובצי PDF שמעלים לקטגוריה של Cloud Storage.

מדריך טעינת נתונים של AI/ML

הדרכה
הדרכות ומדריכים

במדריך הזה נסביר איך לנתח מערכי נתונים גדולים ב-GKE באמצעות BigQuery לאחסון ועיבוד נתונים, Cloud Run לטיפול בבקשות ומודל שפה גדולה (LLM) של Gemma לניתוח נתונים ולתחזיות.

מדריך טעינת נתונים של AI/ML

תרחיש שימוש
תרחישים לדוגמה

במאמר הזה נסביר איך להשתמש ב-GKE וב-Ray כדי לבצע עיבוד מקדים יעיל של מערכי נתונים גדולים ללמידת מכונה.

MLOps Training Ray

תרחיש שימוש
תרחישים לדוגמה

במאמר הזה נסביר איך לקצר את זמן טעינת הנתונים באפליקציות ללמידת מכונה ב-Google Kubernetes Engine.

הסקת מסקנות Hyperdisk ML Cloud Storage FUSE

תרחיש שימוש
תרחישים לדוגמה

כאן מוסבר איך לבצע אופטימיזציה של עלויות ההסקה של ה-GPU על ידי כוונון עדין של Horizontal Pod Autoscaler ב-GKE כדי להשיג יעילות מקסימלית.

Inference GPU HPA

תרחיש שימוש
תרחישים לדוגמה

כאן תלמדו איך לפרוס בקלות מיקרו-שירותים מתקדמים של NVIDIA NIM ב-GKE ולהאיץ את עומסי העבודה של ה-AI.

AI NVIDIA NIM

תרחיש שימוש
תרחישים לדוגמה

איך Ray Operator ב-GKE מפשט את פריסות הייצור של AI/ML, משפר את הביצועים ואת יכולת ההתאמה לגודל.

AI TPU Ray

תרחיש שימוש
תרחישים לדוגמה

במאמר הזה נסביר איך למקסם את קצב העברת הנתונים של מודלים גדולים של שפה (LLM) ב-GPU ב-GKE, כולל החלטות לגבי התשתית ואופטימיזציות של שרת המודלים.

LLM GPU NVIDIA

תרחיש שימוש
תרחישים לדוגמה

איך מפתחים פלטפורמות לעיבוד באצווה ב-GKE ומבצעים בהן אופטימיזציה

Batch Performance Cost optimization

תרחיש שימוש
תרחישים לדוגמה

במאמר הזה מוסבר איך להשתמש בכונני SSD מקומיים כדי לספק אחסון AI/ML עם ביצועים גבוהים ב-GKE.

AI NVMe Local SSD

תרחיש שימוש
תרחישים לדוגמה

במאמר הזה מוסבר איך להריץ אפליקציות JAX מרובות GPU ומרובות צמתים ב-GKE עם יחידות GPU של NVIDIA.

GPUs JAX ML

תרחיש שימוש
תרחישים לדוגמה

איך LiveX AI משתמשת ב-GKE כדי לבנות סוכני AI שמשפרים את שביעות רצון הלקוחות ומפחיתים עלויות.

GenAI NVIDIA GPU

תרחיש שימוש
תרחישים לדוגמה

ארכיטקטורת עזר להפעלת אפליקציית AI גנרטיבי עם יצירה משולבת-אחזור (RAG) באמצעות GKE,‏ Cloud SQL,‏ Ray,‏ Hugging Face ו-LangChain.

GenAI RAG Ray

תרחיש שימוש
תרחישים לדוגמה

ארכיטקטורת עזר לפלטפורמה לעיבוד ברצף (batch processing) ב-GKE במצב רגיל, באמצעות Kueue לניהול מכסות משאבים.

AI Kueue Batch

תרחיש שימוש
תרחישים לדוגמה

איך IPRally משתמשת ב-GKE וב-Ray כדי לבנות פלטפורמת ML יעילה וניתנת להרחבה לחיפושי פטנטים מהירים יותר עם רמת דיוק גבוהה יותר.

AI Ray GPU

תרחיש שימוש
תרחישים לדוגמה

אפשר להשתמש ב-Gemma במעבדים גרפיים ל-Cloud וב-Cloud TPU כדי לשפר את היעילות של היקש ואימון ב-GKE.

AI Gemma ביצועים

תרחיש שימוש
תרחישים לדוגמה

אפשר להשתמש במודלים פתוחים של Gemma כדי ליצור אפליקציות AI ניידות שניתנות להתאמה אישית ולפרוס אותן ב-GKE.

AI Gemma ביצועים

תרחיש שימוש
תרחישים לדוגמה

תזמור של אפליקציות Ray ב-GKE באמצעות KubeRay ו-Kueue.

Kueue Ray KubeRay

תרחיש שימוש
תרחישים לדוגמה

הסבר על יישום תובנות אבטחה וטכניקות לחיזוק האבטחה באימון של עומסי עבודה של AI/ML באמצעות Ray ב-GKE.

AI Ray Security

תרחיש שימוש
תרחישים לדוגמה

בחירה של השילוב הטוב ביותר של אפשרויות אחסון לעומסי עבודה של AI ו-ML ב-Google Cloud.

AI ML Storage

תרחיש שימוש
תרחישים לדוגמה

התקנה אוטומטית של מנהלי התקנים (דרייברים) של Nvidia GPU ב-GKE.

GPU NVIDIA Installation

תרחיש שימוש
תרחישים לדוגמה

אימון מודלים של AI גנרטיבי באמצעות GKE ו-framework של NVIDIA NeMo.

GenAI NVIDIA NeMo

תרחיש שימוש
תרחישים לדוגמה

שימוש ב-GKE לעומסי עבודה של Ray משפר את המדרגיות, את היעילות מבחינת עלויות, את עמידות התקלות, את הבידוד ואת הניידות.

AI Ray Scale

תרחיש שימוש
תרחישים לדוגמה

תהליך פיתוח ופריסה פשוט יותר של מודלים באמצעות Weights & Biases עם GKE.

הוזלת עלויות TPUs GPUs

תרחיש שימוש
תרחישים לדוגמה

עם GKE Autopilot, מקבלים תמיכה משופרת במעבד גרפי, ביצועים טובים יותר ומחירים נמוכים יותר לעומסי עבודה של AI/ML.

GPU Autopilot Performance

תרחיש שימוש
תרחישים לדוגמה

סטארט-אפ מרחיב את הפקת הסרטונים המותאמים אישית באמצעות GKE.

GPU Scale Containers

תרחיש שימוש
תרחישים לדוגמה

איך Ray משנה את פיתוח ה-ML ב-Spotify.

ML Ray Containers

תרחיש שימוש
תרחישים לדוגמה

חברת Ordaōs Bio, אחת מהחברות המובילות בתחום ה-AI שמאיץ מחקרים ביו-רפואיים וגילויים בתחום, מוצאת פתרונות לאימונותרפיה חדשנית באונקולוגיה ובמחלות דלקתיות כרוניות.

ביצועים TPU הוזלת עלויות

תרחיש שימוש
תרחישים לדוגמה

איך סטארט-אפ בעמק הסיליקון, Moloco, רתם את העוצמה של GKE ו-Tensor Flow Enterprise כדי לשפר את תשתית למידת המכונה (ML) שלו.

ML Scale Cost optimization

תרחיש שימוש
תרחישים לדוגמה

כאן מוסבר איך לשפר את זמן ההפעלה של Stable Diffusion ב-GKE.

ביצועים התאמה לעומס PD

דוגמת קוד
דוגמאות קוד

אפשר לראות אפליקציות לדוגמה שמשמשות במדריכים הרשמיים למוצר GKE.

דוגמת קוד
דוגמאות קוד

אתם יכולים לעיין בדוגמאות ניסיוניות לשימוש ב-GKE כדי לקדם את היוזמות שלכם בתחום ה-AI ולמידת המכונה.

דוגמת קוד
דוגמאות קוד

אפשר לעיין בדוגמאות לארכיטקטורות ובפתרונות לפריסת עומסי עבודה מואצים ב-GKE.

סרטונים קשורים