Gemini Enterprise Agent Platform מציעה כמה דרכים להכניס לשימוש בסביבת הייצור מודלים גדולים של שפה (LLM) בקוד פתוח, כולל Llama, DeepSeek, Mistral ו-Qwen, ב- Google Cloud. במסמך הזה מפורטות האפשרויות של Gemini Enterprise Agent Platform להפעלת מודלים פתוחים, והוא יעזור לכם לבחור את האפשרות המתאימה לתרחיש השימוש שלכם.
אפשרויות הצגה
Gemini Enterprise Agent Platform מציעה את האפשרויות הבאות להפעלת מודלים פתוחים. כל אחת מהאפשרויות האלה מספקת זמינות גבוהה וכוללת כברירת מחדל את Google Cloud שיטות העבודה המומלצות לאבטחה:
- Model as a Service (MaaS): שירות של מודלים פתוחים באמצעות ממשקי API מנוהלים ללא שרת.
- מודלים שמוטמעים באופן עצמאי ב-Model Garden: הטמעה של מודלים פתוחים מ-Model Garden באמצעות הטמעה בלחיצה אחת או עם משקלים בהתאמה אישית.
- תמונות קונטיינר מוכנות מראש של Gemini Enterprise Agent Platform: משמשות להצגת מודלים פתוחים באמצעות קונטיינרים מוכנים מראש של frameworks פופולריים להצגת מודלים, למשל vLLM, Hex-LLM ו-TGI.
- קונטיינר vLLM בהתאמה אישית: מאפשר לכם לבנות ולפרוס קונטיינר vLLM בהתאמה אישית כדי לקבל גמישות רבה יותר.
מתי כדאי להשתמש ב-MaaS
כדאי להשתמש ב-MaaS בתרחישים הבאים:
- פיתוח מהיר של אבות טיפוס: MaaS עוזר לשלב במהירות יכולות של מודלים גדולים של שפה (LLM) באפליקציות. זה שימושי במיוחד בשלב הראשוני של המחקר, ליצירת אבות טיפוס מהירה וכשקיצור הזמן עד ליציאה לשוק הוא יעד מרכזי.
- צמצום התקורה התפעולית: כדאי לבחור ב-MaaS אם הצוות רוצה להתמקד בלוגיקה של האפליקציה במקום בניהול התשתית. Google מטפלת בכל ההקצאות, ההתאמות לעומס (scaling) והתחזוקה של GPU/TPU, מה שמסייע לצוותים שמתמקדים בפיתוח אפליקציות ולא ב-MLOps או ב-DevOps.
- תנועה משתנה: מודל התשלום לפי שימוש תומך בעומסי עבודה או באפליקציות ניסיוניות עם דפוסי תנועה בלתי צפויים ומשתנים.
- שימוש מוכן להפעלה: אפשר להשתמש ב-API מנוהל לאפליקציות שזקוקות לביצועים עקביים אבל לא דורשות התאמה אישית מעמיקה של המודל הבסיסי או של מחסנית ההגשה.
- אבטחה ותאימות: MaaS מאפשר לארגונים להשתמש בתכונות המובנות של Google Cloud's אבטחה ותאימות ברמה שמתאימה לארגונים.
- שימוש במודל רגיל: אפשר להשתמש ב-MaaS כשמודל בסיסי רגיל ולא מותאם אישית עונה על הצרכים שלכם.
מתי כדאי להשתמש במודלים שמוטמעים באופן עצמאי ב-Model Garden
אפשרויות להטמעה עצמית כוללות הטמעה מ-Model Garden באמצעות קונטיינרים מוכנים מראש או קונטיינרים בהתאמה אישית. כדאי לשקול הטמעה עצמית בתרחישים המרכזיים הבאים:
- משקלים מותאמים אישית ומודלים שעברו כוונון עדין: פריסה עצמית היא האפשרות הכי טובה אם האפליקציה שלכם דורשת שימוש במשקלים מותאמים אישית או בגרסה שעברה כוונון עדין של מודל, כי היא מאפשרת גמישות רבה יותר בפריסת מודלים שמותאמים לצרכים הספציפיים שלכם. אתם יכולים גם ליצור ולפרוס קונטיינרים מותאמים אישית משלכם. לדוגמה, כדאי להשתמש באפשרות הזו אם מודל מסוים דורש לוגיקה ייחודית של עיבוד מקדים או עיבוד פוסט.
- עומסי עבודה צפויים בנפח גבוה: פריסה עצמית היא אפשרות אסטרטגית וחסכונית ליישומי ייצור עם תנועה צפויה בנפח גבוה. למרות שהיא דורשת השקעה הנדסית גדולה יותר מראש, היא יכולה להוביל לעלות כוללת נמוכה יותר של בעלות (TCO) במהלך חיי היישום, בגלל עלויות אופטימליות לכל טוקן בקנה מידה גדול.
- שליטה מפורטת בתשתית: כדאי להשתמש בפריסה עצמית כשרוצים לבצע אופטימיזציה של הביצועים והתקציב על ידי בחירה של תצורות חומרה ספציפיות. זה כולל בחירה בסוגי מכונה מדויקים, במעבדי GPU (לדוגמה, NVIDIA L4 או H100) או במעבדי TPU, ובמסגרות אופטימליות להצגת מודעות.
- אבטחה ועמידה בדרישות מחמירות: הגישה הזו תומכת באפליקציות שצריכות לעמוד במדיניות ספציפית בנושא מיקום הנתונים או בתקנות מחמירות שאוסרות על שימוש בשירות מנוהל עם דיירים מרובים. היא מאפשרת לפרוס מודלים בצורה מאובטחת בפרויקט וב-Virtual Private Cloud (ענן וירטואלי פרטי) שלכם, ומספקת שליטה מלאה בנתיב הנתונים. Google Cloud
- שליטה מדויקת במיקום: נקודות קצה ייעודיות מאפשרות פריסה בכל מאיץ של Compute Engine ב- Google Cloud בכל האזורים.
מתי כדאי להשתמש במאגרי תגים מוכנים מראש
כדאי להשתמש במאגרי Gemini Enterprise Agent Platform מוכנים מראש בתרחישים הבאים:
- ביצועים אופטימליים: Gemini Enterprise Agent Platform מבצע אופטימיזציה והתאמה אישית של קונטיינרים מוכנים מראש למסגרות כמו vLLM, כדי לשפר את הביצועים, את המהימנות ואת השילוב החלק ב- Google Cloud.
- קלות השימוש: אפשר להפעיל מודלים באמצעות מסגרות פופולריות להפעלת מודלים כמו vLLM, Hex-LLM, SGLang, TGI או TensorRT-LLM, בלי ליצור ולתחזק קובצי אימג' משלכם בקונטיינר.
מתי כדאי להשתמש במאגרי vLLM מותאמים אישית
כדאי לבנות ולהשתמש במאגר תגים מותאם אישית בתרחישים הבאים:
- גמישות מקסימלית: כשאין לכם מספיק אפשרויות להצגת מודעות וקונטיינרים מוכנים מראש, ואתם צריכים שליטה מלאה בקובץ האימג' של הקונטיינר, כולל תלות והגדרות.
- לוגיקה מותאמת אישית להצגת מודעות: כשנדרשים למודל שלכם שלבי עיבוד מקדים או עיבוד אחרי שייחודיים שלא נתמכים על ידי קונטיינרים מוכנים מראש.
המאמרים הבאים
- שימוש במודלים פתוחים עם Model as a Service (MaaS)
- פריסת מודלים פתוחים מ-Model Garden
- פריסת מודלים פתוחים באמצעות קונטיינרים מוכנים מראש
- פריסת מודלים פתוחים באמצעות מאגר vLLM בהתאמה אישית