בדף הזה מוסבר איך פורסים מודל AI גנרטיבי לנקודת קצה לצורך הסקת מסקנות אונליין.
בדיקה ב-Model Garden
אם המודל נמצא ב-Model Garden, אפשר לפרוס אותו בלחיצה על Deploy (זמין לחלק מהמודלים) או על Open Notebook.
אחרת, אפשר לבצע אחת מהפעולות הבאות:
אם המודל שלכם דומה לאחד מהמודלים ב-Model Garden, יכול להיות שתוכלו לעשות שימוש חוזר ישירות באחד מהקונטיינרים של Model Garden.
לפני שמייבאים את המודל אל מאגר המודלים של פלטפורמת הסוכנים של Gemini Enterprise, צריך ליצור קונטיינר מותאם אישית שעומד בדרישות לקונטיינר מותאם אישית להסקת מסקנות. אחרי הייבוא, הוא הופך למשאב
modelשאפשר לפרוס בנקודת קצה.אתם יכולים להשתמש בקבצי Dockerfiles ובסקריפטים שבהם אנחנו משתמשים כדי ליצור את קונטיינרים של Model Garden כנקודת התייחסות או כנקודת התחלה ליצירת קונטיינרים מותאמים אישית משלכם.
הצגת מסקנות באמצעות NVIDIA NIM
NVIDIA Inference Microservices (NIM) הם מודלים של AI שעברו אימון מראש ואופטימיזציה, והם ארוזים כמיקרו-שירותים. הם נועדו לפשט את הפריסה של AI בביצועים גבוהים שמוכן לייצור באפליקציות.
אפשר להשתמש ב-NVIDIA NIM יחד עם Artifact Registry ו-Gemini Enterprise Agent Platform כדי לפרוס מודלים של AI גנרטיבי להסקת מסקנות אונליין.
הגדרות של מאגרי תגים בהתאמה אישית
בקטע הזה מתוארים השדות ב-containerSpec של המודל, שאולי תצטרכו לציין כשמייבאים מודלים של AI גנרטיבי.
אפשר לציין את השדות האלה באמצעות Agent Platform API בארכיטקטורת REST או הפקודה gcloud ai models upload.
מידע נוסף מופיע במאמר בנושא שדות API שקשורים למאגרי תגים.
sharedMemorySizeMbחלק מהמודלים של AI גנרטיבי דורשים יותר זיכרון משותף. זיכרון משותף הוא מנגנון לתקשורת בין תהליכים (IPC) שמאפשר לכמה תהליכים לגשת לבלוק זיכרון משותף ולבצע בו מניפולציות. גודל הזיכרון המשותף שמוגדר כברירת מחדל הוא 64MB.
חלק משרתי המודלים, כמו vLLM או Nvidia Triton, משתמשים בזיכרון משותף כדי לשמור במטמון נתונים פנימיים במהלך הסקת המסקנות של המודל. אם אין מספיק זיכרון משותף, חלק משרתי המודלים לא יכולים להכניס לשימוש בסביבת הייצור היקשים עבור מודלים גנרטיביים. כמות הזיכרון המשותף שנדרשת, אם בכלל, היא פרט הטמעה של הקונטיינר והמודל. כדאי לעיין בהנחיות במסמכי העזרה של שרת המודל.
בנוסף, אפשר להשתמש בזיכרון משותף לתקשורת בין GPU, ולכן שימוש בזיכרון משותף גדול יותר יכול לשפר את הביצועים של מאיצים ללא יכולות NVLink (לדוגמה, L4), אם קובץ ה-container של המודל דורש תקשורת בין GPU.
מידע על הגדרת ערך בהתאמה אישית לזיכרון משותף זמין במאמר בנושא שדות API שקשורים לקונטיינרים.
startupProbeבדיקת מוכנות להפעלה היא בדיקה אופציונלית שמשמשת לזיהוי המועד שבו הקונטיינר מתחיל. הבדיקה הזו משמשת לעיכוב של בדיקת תקינות ושל בדיקות פעילות עד שהקונטיינר מתחיל לפעול. כך אפשר למנוע את סגירתם של קונטיינרים שמתחילים לפעול לאט מדי.
מידע נוסף זמין במאמר בנושא בדיקות תקינות.
healthProbeבדיקת תקינות בודקת אם מאגר מוכן לקבל תנועה. אם לא מספקים בדיקת תקינות, Agent Platform תשתמש בבדיקות התקינות שמוגדרות כברירת מחדל. הבדיקות האלה שולחות בקשת HTTP ליציאה של הקונטיינר ומחפשות תגובה
200 OKמשרת המודל.אם שרת המודלים משיב עם
200 OKלפני שהמודל נטען במלואו, מה שיכול לקרות במיוחד במודלים גדולים, בדיקת תקינות תצליח מוקדם מדי ו-Gemini Enterprise Agent Platform ינתב תנועה אל הקונטיינר לפני שהוא יהיה מוכן.במקרים כאלה, צריך לציין בדיקת תקינות מותאמת אישית שמצליחה רק אחרי שהמודל נטען במלואו ומוכן לקבל תנועה.
מידע נוסף זמין במאמר בנושא בדיקות תקינות.
מגבלות
חשוב לקחת בחשבון את המגבלות הבאות כשפורסים מודלים של AI גנרטיבי:
- אפשר לפרוס מודלים של AI גנרטיבי רק במכונה אחת. פריסה בכמה מארחים לא נתמכת.
- למודלים גדולים מאוד שלא נכנסים לזיכרון ה-vRAM הגדול ביותר שנתמך, כמו Llama 3.1 405B, מומלץ לבצע קוונטיזציה כדי שהם יתאימו.