מאמרי העזרה בנושא תזמור של AI/ML ב-Cloud Run

‫Cloud Run היא פלטפורמה מנוהלת שמאפשרת להריץ אפליקציות בקונטיינרים, כולל עומסי עבודה של AI/ML, ישירות בתשתית הניתנת להתאמה של Google. הוא מטפל בתשתית בשבילכם, כך שאתם יכולים להתמקד בכתיבת הקוד במקום לבזבז זמן על הפעלה, הגדרה ושינוי של גודל המשאבים של Cloud Run. היכולות של Cloud Run מאפשרות לכם:

  • האצת חומרה: גישה ליחידות GPU וניהול שלהן להסקת מסקנות בהיקף נרחב.
  • תמיכה במסגרות עבודה: שילוב עם מסגרות עבודה להפעלת מודלים שאתם כבר מכירים וסומכים עליהן, כמו Hugging Face, ‏ TGI ו-vLLM.
  • פלטפורמה מנוהלת: אתם יכולים ליהנות מכל היתרונות של פלטפורמה מנוהלת כדי לבצע אוטומציה, להרחיב ולשפר את האבטחה של כל מחזור החיים של ה-AI/ML, תוך שמירה על גמישות.

כדאי לעיין במדריכים ובשיטות המומלצות שלנו כדי להבין איך Cloud Run יכול לעזור לכם לבצע אופטימיזציה של עומסי העבודה שלכם בתחום ה-AI/ML.

  • פיתוח באמצעות המודלים והכלים הכי עדכניים של AI גנרטיבי
  • שימוש בחינם ביותר מ-20 מוצרים פופולריים, כולל Compute Engine וממשקי API של AI
  • בלי חיובים אוטומטיים ובלי התחייבות

מוזמנים להתנסות ביותר מ-20 מוצרים חינמיים

אתם יכולים להשתמש ביותר מ-20 מוצרים בחינם לתרחישי שימוש נפוצים, כולל ממשקי API של AI, מכונות וירטואליות, מחסני נתונים (data warehouse) ועוד.

מאמרי עזרה

כאן תוכלו למצוא מדריכים למתחילים ומדריכים נוספים, לעיין בחומרי עזר חשובים ולקבל עזרה לפתרון בעיות נפוצות.
כדי להבין איך משתמשים בפועל בשירותי Google Cloud ומחברים ביניהם, אתם יכולים להיעזר בהדרכות בקצב אישי, בתרחישי שימוש, בארכיטקטורות לדוגמה ובדוגמאות קודים.
תרחיש שימוש
תרחישים לדוגמה

אפשר להריץ קוד לא מהימן שנוצר על ידי AI בצורה בטוחה על ידי פריסת ארגזי חול של Cloud Run שמריצים סביבות הפעלה בתוך קונטיינרים מבודדים שמבוססים על gVisor.

אבטחה ארגז חול ביצוע קוד AI

תרחיש שימוש
תרחישים לדוגמה

אופטימיזציה של זמן האחזור של הפעלה קרה (cold-start) להיקש של LLM בקונטיינרים ב-Cloud Run באמצעות הגדרות תצורה של serverless ושינויים בתבנית עיצוב הארכיטקטורה.

הפעלה מההתחלה (cold startup) זמן אחזור אופטימיזציה מודלים גדולים של שפה (LLM)

תרחיש שימוש
תרחישים לדוגמה

הגדרת כללי הרשאה של Model Context Protocol‏ (MCP) ואכיפה שלהם כדי לאבטח את הקישוריות של כלים מרוחקים לסוכני AI שנפרסו ב-Cloud Run.

Security MCP Agents

תרחיש שימוש
תרחישים לדוגמה

פריסת אפליקציות פול סטאק ב-Cloud Run ישירות ממצב הבנייה של Google AI Studio עם תמיכה משולבת בגיבוי של Firebase ו-Cloud SQL.

AI Studio Firebase Cloud SQL תכנות בשיטת Vibe coding

תרחיש שימוש
תרחישים לדוגמה

אפשר להשתמש ביחידות GPU מסוג NVIDIA L4 ב-Cloud Run כדי להריץ היקש של AI בזמן אמת, כולל יתרונות של הפעלה מהירה (cold-start) וצמצום הפעולה לאפס (scale-to-zero) למודלים גדולים של שפה (LLM).

GPUs LLMs

תרחיש שימוש
תרחישים לדוגמה

איך משתמשים ב-Cloud Run באפליקציות AI שמוכנות לייצור. במדריך הזה מתוארים תרחישי שימוש כמו פיצול תנועה לבדיקות A/B של הנחיות, דפוסי RAG (יצירה משולבת-אחזור) וקישור למאגרי וקטורים.

יישומים של AI פיצול תנועה לבדיקות A/B דפוסי RAG מאגרי וקטורים קישוריות למאגרי וקטורים

תרחיש שימוש
תרחישים לדוגמה

פריסה בלחיצה אחת מ-Google AI Studio ל-Cloud Run ולשרת Cloud Run MCP (Model Context Protocol) כדי להפעיל סוכני AI בסביבות פיתוח משולבות (IDE) או בערכות SDK של סוכנים ולפרוס אפליקציות.

שרתי MCP פריסות Cloud Run

תרחיש שימוש
תרחישים לדוגמה

שילוב של יחידות GPU מסוג NVIDIA L4 עם Cloud Run כדי להפעיל מודלי LLM בצורה חסכונית. במדריך הזה נתמקד בצמצום הפעולה לאפס, ונספק שלבי פריסה למודלים כמו Gemma 2 עם Ollama.

LLMs GPU Ollama Cost Optimization

תרחיש שימוש
תרחישים לדוגמה

הפרדה של קובצי מודלים גדולים מקובץ האימג' של הקונטיינר באמצעות Cloud Storage FUSE. הפרדה משפרת את זמני הבנייה, מפשטת את העדכונים ויוצרת ארכיטקטורה ניתנת להרחבה יותר להצגת מודעות.

אריזת מודלים Cloud Storage FUSE שיטות מומלצות מודלים גדולים

תרחיש שימוש
תרחישים לדוגמה

שימוש במסגרת Cog שעברה אופטימיזציה להצגת מודלים של ML כדי לפשט את האריזה והפריסה של קונטיינרים ב-Cloud Run.

סמל גלגל השיניים Model Packaging Deployment Tutorial

תרחיש שימוש
תרחישים לדוגמה

להשתמש ב-Cloud Run להסקת מסקנות קלה של ML וליצור חבילת כלים חסכונית למעקב באמצעות שירותים מקוריים של Google Cloud Google כמו Logging ו-BigQuery.

מעקב MLOps יעילות בעלויות הסקת מסקנות

סרטונים קשורים