תזמור של AI/ML ב-GKE
Google Kubernetes Engine (GKE) מספק פלטפורמה מאוחדת אחת לתזמור של כל מחזור החיים של פרויקטים של AI/ML. הוא מעניק לכם את העוצמה והגמישות שמאפשרות לכם לשפר את האימון, ההסקה ועומסי העבודה של הסוכנים הדיגיטליים, כך שתוכלו לייעל את התשתית ולהתחיל להשיג תוצאות. יכולות האורקסטרציה המתקדמות ביותר (SOTA) של GKE מספקות את היתרונות הבאים:
- שיפור המהירות באמצעות החומרה: גישה למעבדי GPU ו-TPU חזקים וניהול שלהם, לצורך אימון והסקת מסקנות, בהיקף נרחב.
- גמישות בשימוש בטכנולוגיות שונות: אפשר לשלב עם מסגרות מחשוב מבוזר, עיבוד נתונים והצגת מודלים שאתם כבר מכירים וסומכים עליהן.
- פשטות של Kubernetes מנוהל: אתם מקבלים את כל היתרונות של פלטפורמה מנוהלת לאוטומציה, להרחבה ולשיפור האבטחה של כל מחזור החיים של AI/ML, תוך שמירה על גמישות.
כדאי לעיין בבלוגים, במדריכים ובשיטות המומלצות שלנו כדי ללמוד איך GKE יכול לעזור לכם לייעל את עומסי העבודה של AI/ML. מידע נוסף על היתרונות והתכונות הזמינות מופיע במאמר מבוא לשימוש בעומסי עבודה של AI/ML ב-GKE.
מתחילים לעבוד על הוכחת ההיתכנות בחינם עם קרדיט בשווי 300$
- פיתוח באמצעות המודלים והכלים הכי עדכניים של AI גנרטיבי
- שימוש בחינם ביותר מ-20 מוצרים פופולריים, כולל Compute Engine וממשקי API של AI
- בלי חיובים אוטומטיים ובלי התחייבות
מוזמנים להתנסות ביותר מ-20 מוצרים חינמיים
אתם יכולים להשתמש ביותר מ-20 מוצרים בחינם לתרחישי שימוש נפוצים, כולל ממשקי API של AI, מכונות וירטואליות, מחסני נתונים (data warehouse) ועוד.
מאמרי עזרה
ניהול תשתית ורכיבי האצה של AI
- Concept
- Concept
- Concept
- שיטה מומלצת
- שיטה מומלצת
- שיטה מומלצת
- תחילת העבודה
- סרטון
- סרטון
אימון מודלים של AI בהיקף נרחב
- תחילת העבודה
- מדריך
- מדריך
- מדריך
- מדריך
- תחילת העבודה
- How-to
- מדריך
הצגת מודלים של AI להסקת מסקנות
- שיטה מומלצת
- Concept
- שיטה מומלצת
- How-to
- תחילת העבודה
- מדריך
- מדריך
- מדריך
- מדריך
- מדריך
מקורות מידע שקשורים לנושא
אופטימיזציה של עומסי עבודה של AI ולמידת מכונה באמצעות Cloud Storage ו-GKE
במאמר הזה מוסבר איך להשתמש ב-Cloud Storage FUSE כדי לשפר את הביצועים של עומסי עבודה של AI ו-ML ב-GKE.
אופטימיזציה של עומסי עבודה של AI ו-ML באמצעות Managed Lustre ו-GKE
במאמר הזה נסביר איך להשתמש ב-Managed Lustre כדי לשפר את הביצועים של עומסי עבודה של AI ו-ML ב-GKE.
בידוד של הרצת קוד AI באמצעות ארגז חול לסוכנים
במאמר הזה מוסבר איך להתקין ולהריץ את בקר ארגז החול של הסוכן ב-GKE, ואיך לפרוס בסביבת ארגז חול באשכול כדי לבדוק פקודות shell לא מהימנות.
שימוש ב-Kata Containers בקוד פתוח עם ארגז החול לסוכנים ב-GKE
במאמר הזה נסביר איך להשתמש ב-Kata Containers בקוד פתוח עם ארגז החול לסוכנים ב-GKE כדי לבודד הרצת קוד לא מהימן.
פריסת אפליקציית AI אקטיבי ב-GKE באמצעות ערכה לפיתוח סוכנים (ADK) ו-LLM באירוח עצמי
בקורס הזה תלמדו איך לפרוס ולנהל אפליקציית AI אקטיבי בקונטיינרים ב-GKE, באמצעות הערכה לפיתוח סוכנים (ADK) ו-vLLM להיקש שניתן להרחבה עם Llama 3.1.
פריסת אפליקציית AI אקטיבית ב-GKE באמצעות Agent Development Kit (ADK) ו-Agent Platform
בקורס הזה תלמדו איך לפרוס ולנהל אפליקציית AI אקטיבי בקונטיינרים ב-GKE, באמצעות הערכה לפיתוח סוכנים (ADK) ו-Agent Platform להסקת מסקנות שניתנת להתאמה באמצעות Gemini 2.0 Flash.
הצגת מודלים בקוד פתוח באמצעות יחידות TPU ב-GKE עם Optimum TPU
במאמר הזה מוסבר איך לפרוס מודלים גדולים של שפה (LLM) באמצעות יחידות לעיבוד טנסורים (TPU) ב-GKE עם מסגרת Optimum TPU serving של Hugging Face.
הצגת מודלים גדולים של שפה (LLM) ב-GKE באמצעות אסטרטגיית הקצאת GPU שמותאמת לעלויות וזמינה מאוד
במאמר הזה נסביר איך לבצע אופטימיזציה של עלויות עבור עומסי עבודה (workloads) של מודלים גדולים של שפה (LLM) ב-GKE באמצעות DWS Flex-start.
הפעלת מודלים גדולים של שפה באמצעות KubeRay ב-TPU
במאמר הזה נסביר איך להכניס לשימוש בסביבת הייצור מודלים גדולים של שפה (LLM) באמצעות KubeRay ב-TPU, ואיך זה יכול לעזור לשפר את הביצועים של המודלים.
טעינת נתונים מהירה ל-AI/ML באמצעות Hyperdisk ML
בקורס תלמדו איך לפשט ולהאיץ את הטעינה של משקלים של מודלים של AI/ML ב-GKE באמצעות Hyperdisk ML.
הצגת מודל LLM באמצעות TPU ב-GKE עם JetStream ו-PyTorch
איך להכניס לשימוש בסביבת הייצור מודל LLM באמצעות יחידות לעיבוד טנסורים (TPU) ב-GKE עם JetStream דרך PyTorch.
שיטות מומלצות לאופטימיזציה של היקש LLM באמצעות יחידות GPU ב-GKE
במאמר הזה נסביר על שיטות מומלצות לאופטימיזציה של ביצועי היקש של LLM באמצעות יחידות GPU ב-GKE, בעזרת מסגרות ההגשה vLLM ו-Text Generation Inference (TGI).
ניהול של GPU Stack באמצעות NVIDIA GPU Operator ב-GKE
כאן מוסבר מתי כדאי להשתמש באופרטור NVIDIA GPU ואיך להפעיל אותו ב-GKE.
הגדרת התאמה אוטומטית לעומס (autoscaling) לעומסי עבודה של LLM ב-TPU
במאמר הזה נסביר איך להגדיר את התשתית שלכם להרחבה אוטומטית באמצעות GKE Horizontal Pod Autoscaler (HPA) כדי לפרוס את Gemma LLM באמצעות JetStream במארח יחיד.
שיפור מודלים פתוחים של Gemma באמצעות כמה מעבדים גרפיים ב-GKE
במאמר הזה מוסבר איך לבצע כוונון עדין של מודל שפה גדול (LLM) של Gemma באמצעות יחידות GPU ב-GKE עם ספריית הטרנספורמרים של Hugging Face.
פריסת אפליקציית Ray Serve עם מודל דיפוזיה יציבה ב-GKE עם TPU
בקורס הזה תלמדו איך לפרוס מודל דיפוזיה יציבה ב-GKE ולהכניס אותו לשימוש בסביבת הייצור באמצעות TPU, Ray Serve ותוסף Ray Operator.
הגדרת התאמה אוטומטית לעומס של עומסי עבודה של LLM ביחידות GPU באמצעות GKE
במאמר הזה נסביר איך להגדיר את תשתית הגידול האוטומטי (autoscaling) באמצעות GKE Horizontal Pod Autoscaler (HPA) כדי לפרוס את Gemma LLM עם מסגרת ההגשה Hugging Face Text Generation Interface (TGI).
אימון Llama2 באמצעות Megatron-LM במכונות וירטואליות מסוג A3 Mega
איך מריצים עומס עבודה של Megatron-LM PyTorch מבוסס-קונטיינר ב-A3 Mega.
פריסת עומסי עבודה של GPU ב-Autopilot
איך מבקשים שיפור מהירות באמצעות חומרה (GPUs) בעומסי עבודה ב-GKE Autopilot.
הצגת מודל שפה גדול (LLM) עם כמה מעבדי GPU ב-GKE
במאמר הזה נסביר איך להכניס לשימוש בסביבת הייצור את Llama 2 70B או Falcon 40B באמצעות כמה יחידות GPU של NVIDIA L4 עם GKE.
תחילת העבודה עם Ray ב-GKE
כאן מוסבר איך להתחיל להשתמש ב-Ray ב-GKE בקלות על ידי הפעלת עומס עבודה באשכול Ray.
הצגת LLM ביחידות GPU מסוג L4 באמצעות Ray
איך מפעילים את Falcon 7b, Llama2 7b, Falcon 40b או Llama2 70b באמצעות מסגרת Ray ב-GKE.
תזמור עומסי עבודה של TPU Multislice באמצעות JobSet ו-Kueue
במאמר הזה נסביר איך לתזמר עומס עבודה של Jax בכמה פרוסות TPU ב-GKE באמצעות JobSet ו-Kueue.
מעקב אחרי עומסי עבודה של GPU ב-GKE באמצעות NVIDIA Data Center GPU Manager (DCGM)
איך עוקבים אחרי עומסי עבודה של GPU ב-GKE באמצעות NVIDIA Data Center GPU Manager (DCGM).
מדריך למתחילים: אימון מודל באמצעות מעבדי GPU באשכולות GKE Standard
במדריך למתחילים הזה מוסבר איך לפרוס מודל אימון עם מעבדי GPU ב-GKE ולאחסן את התחזיות ב-Cloud Storage.
הרצת למידת מכונה בהיקף גדול ב-GKE
בסרטון הזה נסביר איך GKE עוזר לפתור אתגרים נפוצים באימון מודלים גדולים של AI בהיקף נרחב, ומהן השיטות המומלצות לאימון מודלים של למידת מכונה בהיקף נרחב ב-GKE ולהצגתם.
TensorFlow ב-GKE Autopilot עם האצת GPU
בפוסט הזה בבלוג מוסבר איך ליצור, להריץ ולבטל notebook של Jupiter עם Tensorflow.
הטמעה של מערכת לתור משימות עם שיתוף מכסות בין מרחבי שמות ב-GKE
במדריך הזה נשתמש ב-Kueue כדי להסביר איך להטמיע מערכת להוספת משימות לתור, ואיך להגדיר שיתוף של משאבי עומס עבודה ומכסות בין מרחבי שמות שונים ב-GKE.
יצירת צ'אטבוט RAG באמצעות GKE ו-Cloud Storage
במדריך הזה נסביר איך לשלב אפליקציה של מודל שפה גדול (LLM) שמבוססת על יצירה משולבת-אחזור (RAG) עם קובצי PDF שמעלים לקטגוריה של Cloud Storage.
ניתוח נתונים ב-GKE באמצעות BigQuery, Cloud Run ו-Gemma
במדריך הזה נסביר איך לנתח מערכי נתונים גדולים ב-GKE באמצעות BigQuery לאחסון ועיבוד נתונים, Cloud Run לטיפול בבקשות ומודל שפה גדולה (LLM) של Gemma לניתוח נתונים ולתחזיות.
Distributed data preprocessing with GKE and Ray: Scaling for the enterprise
במאמר הזה נסביר איך להשתמש ב-GKE וב-Ray כדי לבצע עיבוד מקדים יעיל של מערכי נתונים גדולים ללמידת מכונה.
שיטות מומלצות לטעינת נתונים להסקת מסקנות של AI/ML ב-GKE
במאמר הזה נסביר איך לקצר את זמן טעינת הנתונים באפליקציות ללמידת מכונה ב-Google Kubernetes Engine.
חיסכון ב-GPU: התאמה אוטומטית חכמה יותר לעומסי עבודה של GKE inferencing
כאן מוסבר איך לבצע אופטימיזציה של עלויות ההסקה של ה-GPU על ידי כוונון עדין של Horizontal Pod Autoscaler ב-GKE כדי להשיג יעילות מקסימלית.
הצגת מודלים יעילה של AI שעברו אופטימיזציה באמצעות מיקרו-שירותים של NVIDIA NIM ב-GKE
כאן תלמדו איך לפרוס בקלות מיקרו-שירותים מתקדמים של NVIDIA NIM ב-GKE ולהאיץ את עומסי העבודה של ה-AI.
האצת Ray בסביבת ייצור באמצעות Ray Operator חדש ב-GKE
איך Ray Operator ב-GKE מפשט את פריסות הייצור של AI/ML, משפר את הביצועים ואת יכולת ההתאמה לגודל.
שיפור התפוקה של מודלי שפה גדולים (LLM) בשרתי GPU ב-GKE – מדריך מעשי
במאמר הזה נסביר איך למקסם את קצב העברת הנתונים של מודלים גדולים של שפה (LLM) ב-GPU ב-GKE, כולל החלטות לגבי התשתית ואופטימיזציות של שרת המודלים.
שיטות מומלצות להרצה של עומסי עבודה באצווה ב-GKE
איך מפתחים פלטפורמות לעיבוד באצווה ב-GKE ומבצעים בהן אופטימיזציה
ביצועים גבוהים של אחסון AI/ML באמצעות תמיכה ב-SSD מקומי ב-GKE
במאמר הזה מוסבר איך להשתמש בכונני SSD מקומיים כדי לספק אחסון AI/ML עם ביצועים גבוהים ב-GKE.
למידת מכונה עם JAX ב-Kubernetes עם מעבדי GPU של NVIDIA
במאמר הזה מוסבר איך להריץ אפליקציות JAX מרובות GPU ומרובות צמתים ב-GKE עם יחידות GPU של NVIDIA.
LiveX AI מצמצמת את עלויות התמיכה בלקוחות באמצעות סוכני AI שאומנו ומופעלים ב-GKE וב-NVIDIA AI
איך LiveX AI משתמשת ב-GKE כדי לבנות סוכני AI שמשפרים את שביעות רצון הלקוחות ומפחיתים עלויות.
תשתית לאפליקציית AI גנרטיבי עם יכולות RAG באמצעות GKE ו-Cloud SQL
ארכיטקטורת עזר להפעלת אפליקציית AI גנרטיבי עם יצירה משולבת-אחזור (RAG) באמצעות GKE, Cloud SQL, Ray, Hugging Face ו-LangChain.
דוגמה לארכיטקטורה של פלטפורמה לעיבוד באצווה ב-GKE
ארכיטקטורת עזר לפלטפורמה לעיבוד ברצף (batch processing) ב-GKE במצב רגיל, באמצעות Kueue לניהול מכסות משאבים.
חדשנות בחיפוש פטנטים: איך IPRally ממנפת את ה-AI באמצעות GKE ו-Ray
איך IPRally משתמשת ב-GKE וב-Ray כדי לבנות פלטפורמת ML יעילה וניתנת להרחבה לחיפושי פטנטים מהירים יותר עם רמת דיוק גבוהה יותר.
מידע מעמיק על הביצועים של Gemma ב-Google Cloud
אפשר להשתמש ב-Gemma במעבדים גרפיים ל-Cloud וב-Cloud TPU כדי לשפר את היעילות של היקש ואימון ב-GKE.
Gemma on GKE deep dive: New innovations to serve open generative AI models
אפשר להשתמש במודלים פתוחים של Gemma כדי ליצור אפליקציות AI ניידות שניתנות להתאמה אישית ולפרוס אותן ב-GKE.
תזמון מתקדם של AI/ML באמצעות Ray ו-Kueue
תזמור של אפליקציות Ray ב-GKE באמצעות KubeRay ו-Kueue.
איך מאבטחים את Ray ב-Google Kubernetes Engine
הסבר על יישום תובנות אבטחה וטכניקות לחיזוק האבטחה באימון של עומסי עבודה של AI/ML באמצעות Ray ב-GKE.
תכנון אחסון לעומסי עבודה של AI ולמידת מכונה ב-Google Cloud
בחירה של השילוב הטוב ביותר של אפשרויות אחסון לעומסי עבודה של AI ו-ML ב-Google Cloud.
התקנה אוטומטית של דרייברים מפשטת את השימוש ב-GPU של NVIDIA ב-GKE
התקנה אוטומטית של מנהלי התקנים (דרייברים) של Nvidia GPU ב-GKE.
איך מאיצים את השימוש ב-AI גנרטיבי באמצעות מסגרת NVIDIA NeMo ב-GKEE
אימון מודלים של AI גנרטיבי באמצעות GKE ו-framework של NVIDIA NeMo.
למה כדאי להשתמש ב-GKE לעומסי עבודה של AI ב-Ray?
שימוש ב-GKE לעומסי עבודה של Ray משפר את המדרגיות, את היעילות מבחינת עלויות, את עמידות התקלות, את הבידוד ואת הניידות.
Simplifying MLOps using Weights & Biases with Google Kubernetes Engine
תהליך פיתוח ופריסה פשוט יותר של מודלים באמצעות Weights & Biases עם GKE.
הפעלת AI ב-GKE בניהול מלא, עכשיו עם אפשרויות חדשות למחשוב, תמחור ושמירת משאבים
עם GKE Autopilot, מקבלים תמיכה משופרת במעבד גרפי, ביצועים טובים יותר ומחירים נמוכים יותר לעומסי עבודה של AI/ML.
איך חברת SEEN הגדילה את התפוקה פי 89 והפחיתה את עלויות ה-GPU ב-66% באמצעות GKE
סטארט-אפ מרחיב את הפקת הסרטונים המותאמים אישית באמצעות GKE.
How Spotify is unleashing ML Innovation with Ray and GKE
איך Ray משנה את פיתוח ה-ML ב-Spotify.
איך Ordaōs Bio משתמשת ב-AI גנרטיבי ב-GKE
חברת Ordaōs Bio, אחת מהחברות המובילות בתחום ה-AI שמאיץ מחקרים ביו-רפואיים וגילויים בתחום, מוצאת פתרונות לאימונותרפיה חדשנית באונקולוגיה ובמחלות דלקתיות כרוניות.
GKE מסטארט-אפ צומח שמבוסס על ML
איך סטארט-אפ בעמק הסיליקון, Moloco, רתם את העוצמה של GKE ו-Tensor Flow Enterprise כדי לשפר את תשתית למידת המכונה (ML) שלו.
שיפור של פי 4 בזמן ההפעלה של Stable Diffusion ב-GKE
כאן מוסבר איך לשפר את זמן ההפעלה של Stable Diffusion ב-GKE.
דוגמאות ל-Google Kubernetes Engine (GKE)
אפשר לראות אפליקציות לדוגמה שמשמשות במדריכים הרשמיים למוצר GKE.
GKE AI Labs Samples
אתם יכולים לעיין בדוגמאות ניסיוניות לשימוש ב-GKE כדי לקדם את היוזמות שלכם בתחום ה-AI ולמידת המכונה.
GKE Accelerated Platforms
אפשר לעיין בדוגמאות לארכיטקטורות ובפתרונות לפריסת עומסי עבודה מואצים ב-GKE.