במסמך הזה מוסבר איך לפרוס מודלים פתוחים ב-Gemini Enterprise Agent Platform ולהשתמש בהם באמצעות תמונות קונטיינר מוכנות מראש. Gemini Enterprise Agent Platform מספק קונטיינרים מוכנים מראש למסגרות פופולריות להצגת מודלים כמו vLLM, Hex-LLM ו-SGLang, וגם תמיכה ב-Text Generation Inference (TGI), Text Embeddings Inference (TEI), Inference Toolkit (באמצעותGoogle Cloud Hugging Face PyTorch Inference Containers) וקונטיינרים של Tensor-RT-LLM של Hugging Face כדי להשתמש במודלים נתמכים ב-Gemini Enterprise Agent Platform.
vLLM היא ספרייה בקוד פתוח להסקת מסקנות מהירה ולפרסום של מודלים גדולים של שפה (LLM). Gemini Enterprise Agent Platform משתמשת בגרסה מותאמת וממוטבת של vLLM. הגרסה הזו מיועדת במיוחד לשיפור הביצועים, המהימנות והשילוב החלק בתוך Google Cloud. אתם יכולים להשתמש בתמונת קונטיינר מותאמת אישית של vLLM ב-Gemini Enterprise Agent Platform כדי להפעיל מודלים ב-Gemini Enterprise Agent Platform. מאגר ה-vLLM שנבנה מראש יכול להוריד מודלים מ-Hugging Face או מ-Cloud Storage. מידע נוסף על הגשת מודלים באמצעות תמונות קונטיינר מוכנות מראש של vLLM ב-Gemini Enterprise Agent Platform זמין במאמר הגשת מודלים באמצעות תמונות קונטיינר מוכנות מראש של vLLM ב-Gemini Enterprise Agent Platform.
דוגמאות ל-notebook
במחברות הבאות מודגם איך להשתמש במאגרי תבניות מוכנות מראש של Gemini Enterprise Agent Platform להצגת מודלים. דוגמאות נוספות של נוטבוקים זמינות במאגר GitHub של דוגמאות ל-Gemini Enterprise Agent Platform.
| שם ה-Notebook | תיאור | קישור ישיר (GitHub/Colab) |
|---|---|---|
| Gemini Enterprise Agent Platform Model Garden – Gemma 3 (פריסה) | הדגמה של פריסת מודלים של Gemma 3 ב-GPU באמצעות vLLM. | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden – מילו בקשות של Llama 3.2 מרובה-אופנים באמצעות vLLM | פריסת מודלים מרובי-מוֹדָל של Llama 3.2 באמצעות קונטיינר מוכן מראש של vLLM. | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden - Hugging Face Text Generation Inference Deployment | הדגמה של פריסת מודל Gemma-2-2b-it באמצעות Text Generation Inference (TGI) מ-Hugging Face | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden - Hugging Face Text Embeddings Inference Deployment | הדגמה של פריסת nomic-ai/nomic-embed-text-v1 באמצעות Text Embeddings Inference (TEI) מ-Hugging Face | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden - Hugging Face PyTorch Inference Deployment | הדגמה של פריסת distilbert/distilbert-base-uncased-finetuned-sst-2-english באמצעות Hugging Face PyTorch Inference | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden – פריסת DeepSeek | הדגמה של פרסום מודלים של DeepSeek באמצעות vLLM, SGLang או TensorRT-LLM | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden - Qwen3 Deployment | הדגמה של פרסום מודלים של Qwen3 באמצעות SGLang | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden – פריסת Gemma 3n | הדגמה של מילו בקשות של מודלים של Gemma3n באמצעות SGLang | הצגת הקוד ב-GitHub |
| Gemini Enterprise Agent Platform Model Garden – מידע מעמיק: פריסת Llama 3.1 ו-3.2 באמצעות Hex-LLM | הדגמה של פריסת מודלים של Llama 3.1 ו-3.2 באמצעות Hex-LLM ב-TPU באמצעות Gemini Enterprise Agent Platform Model Garden | הצגת הקוד ב-GitHub |
המאמרים הבאים
- בחירת אפשרות לפרסום מודלים פתוחים
- שימוש במודלים פתוחים באמצעות Model as a Service (MaaS)
- פריסת מודלים פתוחים מ-Model Garden
- פריסת מודלים פתוחים באמצעות מאגר vLLM בהתאמה אישית