פריסת מודל לנקודת קצה

כדי לקבל מסקנות אונליין ממודל שאומן, צריך לפרוס את המודל לנקודת קצה. אפשר לעשות את זה באמצעות מסוף Google Cloud ,‏ Google Cloud CLI או Gemini Enterprise API.

במסמך הזה מתואר תהליך הפריסה של מודלים לנקודות קצה.

מה קורה כשפורסים מודל

פריסת מודל משייכת משאבים פיזיים למודל, כדי שיוכל להכניס לשימוש בסביבת הייצור מסקנות אונליין עם זמן אחזור קצר.

אפשר לפרוס כמה מודלים לנקודת קצה אחת, או לפרוס את אותו מודל לכמה נקודות קצה. מידע נוסף זמין במאמר בנושא הסיבות לפריסת יותר ממודל אחד באותה נקודת קצה.

הכנות לפריסת מודל בנקודת קצה

במהלך פריסת המודל, מקבלים את ההחלטות החשובות הבאות לגבי אופן ההפעלה של הסקת מסקנות אונליין:

משאב נוצר ההגדרה שצוינה בזמן יצירת המשאב
נקודת קצה (endpoint) המיקום שבו יופעלו ההסקות
דגם מאגר לשימוש (ModelContainerSpec)
DeployedModel משאבי מחשוב לשימוש בהסקת מסקנות אונליין

אחרי שמפריסים את המודל לנקודת הקצה, אי אפשר לשנות את הגדרות הפריסה האלה. כדי לשנות אותן, צריך לפרוס מחדש את המודל.

השלב הראשון בתהליך הפריסה הוא להחליט באיזה סוג של נקודת קצה להשתמש. מידע נוסף זמין במאמר בחירת סוג נקודת קצה.

לאחר מכן, מוודאים שהמודל גלוי במאגר המודלים של Gemini Enterprise Agent Platform. הפרמטר הזה נדרש כדי שיהיה אפשר לפרוס את המודל. מידע על Model Registry, כולל איך לייבא ארטיפקטים של מודלים או ליצור אותם ישירות ב-Model Registry, זמין במאמר מבוא ל-Model Registry של Gemini Enterprise Agent Platform.

ההחלטה הבאה שצריך לקבל היא באילו משאבי מחשוב להשתמש כדי להפעיל את המודל. סוג האימון של המודל (AutoML או מותאם אישית) וסוג הנתונים (AutoML) קובעים את סוגי המשאבים הפיזיים שזמינים למודל. אחרי פריסת המודל, אפשר mutate חלק מהמשאבים האלה בלי ליצור פריסה חדשה.

משאב נקודת הקצה מספק את נקודת הקצה של השירות (כתובת URL) שבה משתמשים כדי לבקש את ההסקה. לדוגמה:

   https://us-central1-aiplatform.googleapis.com/v1/projects/{project}/locations/{location}/endpoints/{endpoint}:predict

פריסת מודל בנקודת קצה

אפשר לפרוס מודל לנקודת קצה באמצעות המסוף Google Cloud או באמצעות ה-CLI של gcloud או Gemini Enterprise API.

פריסת מודל לנקודת קצה ציבורית באמצעות Google Cloud המסוף

ב Google Cloud מסוף, אפשר לפרוס מודל לנקודת קצה ציבורית קיימת ייעודית או משותפת, או ליצור נקודת קצה חדשה במהלך תהליך הפריסה. לפרטים, אפשר לעיין במאמר פריסת מודל באמצעות Google Cloud המסוף.

פריסת מודל לנקודת קצה ציבורית באמצעות ה-CLI של gcloud או Gemini Enterprise API

כשפורסים מודל באמצעות ה-CLI של gcloud או Gemini Enterprise API, צריך קודם ליצור נקודת קצה ייעודית או משותפת ואז לפרוס את המודל לנקודת הקצה. לפרטים נוספים:

  1. יצירה של נקודת קצה ציבורית ייעודית או משותפת
  2. פריסת מודל באמצעות ה-CLI של gcloud או Gemini Enterprise API

פריסת מודל לנקודת קצה של Private Service Connect

לפרטים, אפשר לעיין במאמר בנושא שימוש בנקודות קצה של Private Service Connect להסקת מסקנות אונליין.

שימוש בפריסה מתגלגלת לעדכון מודל שנפרס

אפשר להשתמש בפריסה מתגלגלת כדי להחליף מודל שפריסתו הושלמה בגרסה חדשה של אותו מודל. המודל החדש משתמש מחדש במשאבי החישוב של המודל הקודם. לפרטים נוספים, אפשר לעיין במאמר שימוש בפריסה מתגלגלת כדי להחליף מודל שפריסתו הושלמה.

ביטול הפריסה של מודל ומחיקת נקודת הקצה

אפשר לבטל את הפריסה של מודל ולמחוק את נקודת הקצה. פרטים נוספים זמינים במאמר בנושא ביטול הפריסה של מודל ומחיקת נקודת הקצה.

סיבות לפריסת יותר ממודל אחד לנקודת קצה אחת

פריסת שני מודלים לאותה נקודת קצה מאפשרת להחליף בהדרגה מודל אחד במודל אחר. לדוגמה, נניח שאתם משתמשים במודל ומצאתם דרך להגדיל את רמת הדיוק של המודל באמצעות נתוני אימון חדשים. עם זאת, אתם לא רוצים לעדכן את האפליקציה כך שתפנה לכתובת URL חדשה של נקודת קצה, ולא רוצים ליצור שינויים פתאומיים באפליקציה. אפשר להוסיף את המודל החדש לאותה נקודת קצה, להקצות לו אחוז קטן מהתנועה ולהגדיל בהדרגה את חלוקת התנועה למודל החדש עד שהוא יקבל 100% מהתנועה.

המשאבים משויכים למודל ולא לנקודת הקצה, ולכן אפשר לפרוס מודלים מסוגים שונים לאותה נקודת קצה. עם זאת, מומלץ לפרוס מודלים מסוג ספציפי (למשל, AutoML טבלאי או מודל שעבר אימון בהתאמה אישית) לנקודת קצה. קל יותר לנהל את ההגדרה הזו.

סיבות לפריסת מודל ליותר מנקודת קצה אחת

יכול להיות שתרצו לפרוס את המודלים שלכם עם משאבים שונים לסביבות אפליקציה שונות, כמו סביבות בדיקה וסביבות ייצור. יכול להיות שתרצו גם לתמוך ביעדי זמינות שונים לבקשות ההסקה שלכם. יכול להיות שאחת מהאפליקציות שלכם דורשת ביצועים גבוהים בהרבה מהאחרות. במקרה כזה, תוכלו לפרוס את המודל לנקודת קצה עם ביצועים גבוהים יותר ועם יותר משאבי מכונה. כדי לייעל את העלויות, תוכלו גם לפרוס את המודל לנקודת קצה עם ביצועים נמוכים יותר ועם פחות משאבי מכונה.

התנהגות ההתאמה להיקף

התכונה 'התאמה אוטומטית לעומס של הסקת מסקנות' ב-Vertex AI Inference משנה את מספר הצמתים להסקת מסקנות בהתאם למספר הבקשות המקבילות. כך אפשר להתאים באופן דינמי את מספר הצמתים לעומסי בקשות משתנים ולנהל את העלויות. מידע נוסף זמין במאמר בנושא שינוי קנה מידה של צמתים להסקת מסקנות ב-Vertex AI Inference.

המאמרים הבאים