פריסת מודלים של AI גנרטיבי

בדף הזה מוסבר איך פורסים מודל AI גנרטיבי לנקודת קצה לצורך הסקת מסקנות אונליין.

בדיקה ב-Model Garden

אם המודל נמצא ב-Model Garden, אפשר לפרוס אותו בלחיצה על Deploy (זמין לחלק מהמודלים) או על Open Notebook.

כניסה ל-Model Garden

אחרת, אפשר לבצע אחת מהפעולות הבאות:

הצגת מסקנות באמצעות NVIDIA NIM

NVIDIA Inference Microservices (NIM) הם מודלים של AI שעברו אימון מראש ואופטימיזציה, והם ארוזים כמיקרו-שירותים. הם נועדו לפשט את הפריסה של AI בביצועים גבוהים שמוכן לייצור באפליקציות.

אפשר להשתמש ב-NVIDIA NIM יחד עם Artifact Registry ו-Gemini Enterprise Agent Platform כדי לפרוס מודלים של AI גנרטיבי להסקת מסקנות אונליין.

הגדרות של מאגרי תגים בהתאמה אישית

בקטע הזה מתוארים השדות ב-containerSpec של המודל, שאולי תצטרכו לציין כשמייבאים מודלים של AI גנרטיבי.

אפשר לציין את השדות האלה באמצעות Agent Platform API בארכיטקטורת REST או הפקודה gcloud ai models upload. מידע נוסף מופיע במאמר בנושא שדות API שקשורים למאגרי תגים.

sharedMemorySizeMb

חלק מהמודלים של AI גנרטיבי דורשים יותר זיכרון משותף. זיכרון משותף הוא מנגנון לתקשורת בין תהליכים (IPC) שמאפשר לכמה תהליכים לגשת לבלוק זיכרון משותף ולבצע בו מניפולציות. גודל הזיכרון המשותף שמוגדר כברירת מחדל הוא 64MB.

חלק משרתי המודלים, כמו vLLM או Nvidia Triton, משתמשים בזיכרון משותף כדי לשמור במטמון נתונים פנימיים במהלך הסקת המסקנות של המודל. אם אין מספיק זיכרון משותף, חלק משרתי המודלים לא יכולים להכניס לשימוש בסביבת הייצור היקשים עבור מודלים גנרטיביים. כמות הזיכרון המשותף שנדרשת, אם בכלל, היא פרט הטמעה של הקונטיינר והמודל. כדאי לעיין בהנחיות במסמכי העזרה של שרת המודל.

בנוסף, אפשר להשתמש בזיכרון משותף לתקשורת בין GPU, ולכן שימוש בזיכרון משותף גדול יותר יכול לשפר את הביצועים של מאיצים ללא יכולות NVLink (לדוגמה, L4), אם קובץ ה-container של המודל דורש תקשורת בין GPU.

מידע על הגדרת ערך בהתאמה אישית לזיכרון משותף זמין במאמר בנושא שדות API שקשורים לקונטיינרים.

startupProbe

בדיקת מוכנות להפעלה היא בדיקה אופציונלית שמשמשת לזיהוי המועד שבו הקונטיינר מתחיל. הבדיקה הזו משמשת לעיכוב של בדיקת תקינות ושל בדיקות פעילות עד שהקונטיינר מתחיל לפעול. כך אפשר למנוע את סגירתם של קונטיינרים שמתחילים לפעול לאט מדי.

מידע נוסף זמין במאמר בנושא בדיקות תקינות.

healthProbe

בדיקת תקינות בודקת אם מאגר מוכן לקבל תנועה. אם לא מספקים בדיקת תקינות, Agent Platform תשתמש בבדיקות התקינות שמוגדרות כברירת מחדל. הבדיקות האלה שולחות בקשת HTTP ליציאה של הקונטיינר ומחפשות תגובה 200 OK משרת המודל.

אם שרת המודלים משיב עם 200 OK לפני שהמודל נטען במלואו, מה שיכול לקרות במיוחד במודלים גדולים, בדיקת תקינות תצליח מוקדם מדי ו-Gemini Enterprise Agent Platform ינתב תנועה אל הקונטיינר לפני שהוא יהיה מוכן.

במקרים כאלה, צריך לציין בדיקת תקינות מותאמת אישית שמצליחה רק אחרי שהמודל נטען במלואו ומוכן לקבל תנועה.

מידע נוסף זמין במאמר בנושא בדיקות תקינות.

מגבלות

חשוב לקחת בחשבון את המגבלות הבאות כשפורסים מודלים של AI גנרטיבי:

  • אפשר לפרוס מודלים של AI גנרטיבי רק במכונה אחת. פריסה בכמה מארחים לא נתמכת.
  • למודלים גדולים מאוד שלא נכנסים לזיכרון ה-vRAM הגדול ביותר שנתמך, כמו Llama 3.1 405B, מומלץ לבצע קוונטיזציה כדי שהם יתאימו.