מודלים של Llama זמינים לשימוש כממשקי API מנוהלים וכמודלים שניתנים לפריסה עצמית בפלטפורמת הסוכנים של Gemini Enterprise. אתם יכולים להזרים את התשובות כדי לצמצם את זמן האחזור שנתפס על ידי משתמשי הקצה. תשובה מוזרמת משתמשת באירועים שנשלחים מהשרת (SSE) כדי להזרים את התשובה באופן מצטבר.
מודלים מנוהלים של Llama
מודלים של Llama מוצעים כממשקי API מנוהלים לחלוטין וללא שרתים. כדי להשתמש במודל Llama בפלטפורמת הסוכנים, שולחים בקשה ישירות לנקודת הקצה של Agent Platform API. כשמשתמשים במודלים של Llama כממשקי API מנוהלים, אין צורך להקצות או לנהל תשתית.
המודלים הבאים של Llama זמינים לשימוש ב-Gemini Enterprise Agent Platform. כדי לגשת למודל Llama, עוברים לכרטיס המודל שלו ב-Model Garden.
Llama 4 Maverick 17B-128E
Llama 4 Maverick 17B-128E הוא מודל Llama 4 הגדול והמתקדם ביותר, שמציע יכולות קידוד, חשיבה רציונלית ותמונה. הוא כולל ארכיטקטורה של שילוב מומחים (MoE) עם 17 מיליארד פרמטרים פעילים מתוך 400 מיליארד פרמטרים בסך הכול ו-128 מומחים. מודל Llama 4 Maverick 17B-128E משתמש בשכבות MoE ובשכבות צפופות לסירוגין, שבהן כל טוקן מפעיל מומחה משותף בתוספת אחד מ-128 המומחים המנותבים. המודל מאומן מראש ב-200 שפות ועבר אופטימיזציה לאינטראקציות צ'אט באיכות גבוהה באמצעות פייפליין עיבוד משופר אחרי האימון.
Llama 4 Maverick 17B-128E הוא מודל מולטי-מודאלי שמתאים לתיאור תמונות מתקדם, לניתוח תמונות, להבנה מדויקת של תמונות, לשאלות ותשובות חזותיות, ליצירת טקסט יצירתי, לעוזרים מבוססי-AI לשימוש כללי ולצ'אטבוטים מתוחכמים שדורשים רמת אינטליגנציה והבנה של תמונות מהשורה הראשונה.
לתשומת ליבכם
- אפשר לכלול עד שלוש תמונות בכל בקשה.
- נקודת הקצה של MaaS לא משתמשת ב-Llama Guard, בניגוד לגרסאות קודמות. כדי להשתמש ב-Llama Guard, פורסים את Llama Guard מ-Model Garden ואז שולחים את ההנחיות והתשובות לנקודת הקצה הזו. עם זאת, בהשוואה ל-Llama 4, ההקשר של Llama Guard מוגבל יותר (128,000) והוא יכול לעבד רק בקשות עם תמונה אחת בתחילת ההנחיה.
- אין תמיכה בתחזיות אצווה.
Llama 4 Scout 17B-16E
Llama 4 Scout 17B-16E מספק תוצאות מתקדמות ביחס לגודל שלו, והוא עולה בביצועים על דורות קודמים של Llama ועל מודלים אחרים קנייניים ופתוחים בכמה מדדים. הוא כולל ארכיטקטורת MoE עם 17 מיליארד פרמטרים פעילים מתוך 109 מיליארד פרמטרים בסך הכול ו-16 מומחים.
Llama 4 Scout 17B-16E מתאים למשימות אחזור בהקשרים ארוכים ולמשימות שדורשות חשיבה רציונלית על כמויות גדולות של מידע, כמו סיכום של כמה מסמכים גדולים, ניתוח של יומני אינטראקציה מקיפים של משתמשים לצורך התאמה אישית וניתוח של בסיסי קוד גדולים.
לתשומת ליבכם
- אפשר לכלול עד שלוש תמונות בכל בקשה.
- נקודת הקצה של MaaS לא משתמשת ב-Llama Guard, בניגוד לגרסאות קודמות. כדי להשתמש ב-Llama Guard, פורסים את Llama Guard מ-Model Garden ואז שולחים את ההנחיות והתשובות לנקודת הקצה הזו. עם זאת, בהשוואה ל-Llama 4, ההקשר של Llama Guard מוגבל יותר (128,000) והוא יכול לעבד רק בקשות עם תמונה אחת בתחילת ההנחיה.
- אין תמיכה בתחזיות אצווה.
Llama 3.3
Llama 3.3 הוא מודל עם 70 מיליארד פרמטרים שעבר כוונון לפי הוראות, והוא מיועד רק ליצירת טקסט. הוא מספק ביצועים משופרים בהשוואה ל-Llama 3.1 70B ול-Llama 3.2 90B כשמשתמשים בו באפליקציות שמיועדות רק ליצירת טקסט.
מעבר לכרטיס של מודל Llama 3.3 70B
שימוש במודלים של Llama
במודלים מנוהלים, אפשר להשתמש בפקודות curl כדי לשלוח בקשות לנקודת הקצה של Gemini Enterprise Agent Platform באמצעות שמות המודלים הבאים. במאמר קריאה לממשקי API של מודלים פתוחים מוסבר איך לבצע שיחות סטרימינג ושיחות רגילות למודלים של Llama.
כדי להשתמש במודל של Gemini Enterprise Agent Platform שפרסתם בעצמכם:
- עוברים אל מסוף Model Garden.
- מאתרים את המודל הרלוונטי של Gemini Enterprise Agent Platform.
- לוחצים על הפעלה וממלאים את הטופס שמופיע כדי לקבל את הרישיונות הנדרשים לשימוש מסחרי.
מידע נוסף על פריסה ושימוש במודלים של שותפים זמין במאמר פריסת מודל של שותף ושליחת בקשות לחיזוי.