בדף הזה מוסבר איך לבצע כוונון עדין מפוקח וזיקוק במודלים פתוחים כמו Llama 3.1. אלא אם צוין אחרת, ההוראות בדף הזה חלות גם על כוונון מפוקח (SFT) וגם על כוונון עדין של זיקוק. זיקוק מאפשר לכם לכוונן מודל סטודנט קטן יותר באמצעות הפלטים של מודל מורה גדול יותר.
מצבי התאמה אישית נתמכים
- כוונון מפוקח (SFT):
- כוונון עדין מלא
- Low-Rank Adaptation (LoRA): LoRA הוא מצב של כוונון יעיל של פרמטרים שמשנה רק קבוצת משנה של פרמטרים. היא חסכונית יותר בעלויות ודורשת פחות נתוני אימון מאשר כוונון עדין מלא. מצד שני, לשינוי מלא של הפרמטרים יש פוטנציאל לאיכות גבוהה יותר.
- כוונון באמצעות זיקוק: כוונון באמצעות זיקוק מתבצע באמצעות GenAI SDK. במסגרת הכוונון הזה, מציינים מודל מורה שיוצר תשובות, ואז משתמשים בתשובות האלה כדי לכוונן מודל תלמיד קטן יותר.
תרחישי שימוש מומלצים לשיפור דיוק באמצעות זיקוק
התאמה עדינה של זיקוק היא הכי יעילה כשמודל המורה מסוגל לבצע את משימת היעד באופן משמעותי יותר טוב ממודל התלמיד. מומלץ להשתמש בה כדי להעביר יכולות הסקה מורכבות ורב-שלביות ממורה גדול יותר לתלמיד קטן יותר, כולל:
- מתמטיקה והסקה כמותית
- מענה לשאלות בתחומים ספציפיים כמו מדע ורפואה, שדורש חשיבה רציונלית צעד אחר צעד
- משימות אחרות שבהן מודל מורה חזק עם התנהגות של 'חשיבה' או 'שרשרת מחשבות' מפיק באופן עקבי תשובות באיכות גבוהה יותר מהתלמיד.
הזיקוק מספק רווחים קטנים יותר במשימות שבהן מודל התלמיד כבר מתפקד קרוב למודל המורה, או במשימות אחזור קצרות שבהן עקבות הנימוקים של מודל המורה לא מוסיפות ערך.
מודלים נתמכים
מודלים נתמכים של כוונון מפוקח (SFT)
- Gemma 4 E2B IT (
google/gemma4@gemma-4-e2b-it) - Gemma 4 E4B IT (
google/gemma4@gemma-4-e4b-it) - Gemma 4 26B A4B IT (
google/gemma4@gemma-4-26b-a4b-it) - Gemma 4 31B IT (
google/gemma4@gemma-4-31b-it) - Gemma 3 1B IT (
google/gemma3@gemma-3-1b-it) - Gemma 3 4B IT (
google/gemma3@gemma-3-4b-it) - Gemma 3 12B IT (
google/gemma3@gemma-3-12b-it) - Gemma 3 27B IT (
google/gemma3@gemma-3-27b-it) - Medgemma 1.5 4B IT (
google/medgemma@medgemma-1.5-4b-it) - Qwen 3.6 27B (
qwen/qwen3-6@qwen3.6-27b) - Qwen 3.6 35B A3B (
qwen/qwen3-6@qwen3.6-35b-a3b) - Qwen 3.5 9B (
qwen/qwen3-5@qwen3.5-9b) - Qwen 3 4B (
qwen/qwen3@qwen3-4b) - Qwen 3 8B (
qwen/qwen3@qwen3-8b) - Qwen 3 14B (
qwen/qwen3@qwen3-14b) - Qwen 3 32B (
qwen/qwen3@qwen3-32b) - Llama 3.1 8B (
meta/llama3_1@llama-3.1-8b) - Llama 3.1 8B Instruct (
meta/llama3_1@llama-3.1-8b-instruct) - Llama 3.2 1B Instruct (
meta/llama3-2@llama-3.2-1b-instruct) - Llama 3.2 3B Instruct (
meta/llama3-2@llama-3.2-3b-instruct) - Llama 3.3 70B Instruct (
meta/llama3-3@llama-3.3-70b-instruct) - Llama 4 Scout 17B 16E Instruct (
meta/llama4@llama-4-scout-17b-16e-instruct) - GLM 4.7 Flash (
zai-org/glm-4.7-flash@glm-4.7-flash)
מודלים נתמכים של כוונון זיקוק
מודלים נתמכים למורים:
- DeepSeek R1 0528 MaaS (
deepseek-ai/deepseek-r1-0528-maas) - DeepSeek V3.2 MaaS (
deepseek-ai/deepseek-v3.2-maas) - GLM 5.2 MaaS (
zai-org/glm-5.2-maas) - Kimi K2 Thinking MaaS (
moonshotai/kimi-k2-thinking-maas) - Qwen 3 Next 80B A3B Thinking MaaS (
qwen/qwen3-next-80b-a3b-thinking-maas)
מודלים נתמכים לסטודנטים:
- Qwen 3 4B (
qwen/qwen3@qwen3-4b) - Qwen 3 8B (
qwen/qwen3@qwen3-8b) - Qwen 3 14B (
qwen/qwen3@qwen3-14b) - Qwen 3 32B (
qwen/qwen3@qwen3-32b) - Gemma 3 1B IT (
google/gemma3@gemma-3-1b-it) - Gemma 3 4B IT (
google/gemma3@gemma-3-4b-it) - Gemma 3 12B IT (
google/gemma3@gemma-3-12b-it) - Gemma 3 27B IT (
google/gemma3@gemma-3-27b-it)
אזורים נתמכים
מומלץ מאוד להשתמש בנקודת קצה גלובלית (global) להפעלת משימות כוונון. המערכת תבחר אזור נתמך עם קיבולת זמינה ותפעיל משימת כוונון.
כשמפעילים משימה מנקודת הקצה הגלובלית, חשוב להביא בחשבון את הנקודות הבאות:
- כשיוצרים משימת התאמה גלובלית, נוצרת משימת התאמה אזורית תואמת (באזור שנבחר). תחויבו רק על המכסה ותקבלו חשבון על משימת כוונון אחת.
- משאבי משנה (כמו ניסויים או מודלים של TensorBoard) ייצרו באזור היעד שנבחר. אפשר לחלץ את המיקום משם המשאב המלא ולשאול שאילתה באמצעות Vertex AI SDK.
משימות כוונון ספציפיות לאזור עדיין זמינות למשתמשים עם צרכים מתקדמים יותר (למשל, כל המשאבים בהיקף של אזור יחיד):
- איווה (
us-central1) - הולנד (
europe-west4) - אורגון (
us-west1) - Columbus (
us-east5) - סינגפור (
asia-southeast1) - ג'אקארטה (
asia-southeast2)
מגבלות
| דגם | מפרט | ערך |
|---|---|---|
| Gemma 4 E2B IT | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 4 E4B IT | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 4 26B A4B IT | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 4 31B IT | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 3 1B IT | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 3 4B IT | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 3 12B IT | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Gemma 3 27B IT | מצבי כוונון | כוונון יעיל בפרמטרים כוונון מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Medgemma 1.5 4B IT | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3.6 27B | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 12288 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3.6 35B A3B | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 12288 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3.5 9B | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3 4B | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3 8B | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3 14B | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Qwen 3 32B | מצבי כוונון | כוונון יעיל בפרמטרים כוונון מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Llama 3.1 8B | מצבי כוונון | כוונון יעיל בפרמטרים כוונון מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Llama 3.1 8B Instruct | מצבי כוונון | כוונון יעיל בפרמטרים כוונון מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Llama 3.2 1B Instruct | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Llama 3.2 3B Instruct | מצבי כוונון | כוונון עדין מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Llama 3.3 70B Instruct | מצבי כוונון | כוונון יעיל בפרמטרים כוונון מלא |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט | |
| Llama 4 Scout 17B 16E Instruct | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 2048 | |
| אמצעי תחבורה | טקסט תמונות* *אין תמיכה במערכי נתונים מעורבים של דוגמאות טקסט בלבד ודוגמאות של תמונות. אם יש לפחות דוגמה אחת של תמונה במערך הנתונים, כל הדוגמאות של טקסט בלבד יסוננו. |
|
| GLM 4.7 Flash | מצבי כוונון | כוונון יעיל בפרמטרים |
| אורך הרצף המקסימלי | 8192 | |
| אמצעי תחבורה | טקסט |
לפני שמתחילים
- נכנסים לחשבון Google Cloud . אנחנו ממליצים למשתמשים חדשים ב- Google Cloud ליצור חשבון כדי שיוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Gemini Enterprise Agent Platform and Cloud Storage APIs, if any are not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Gemini Enterprise Agent Platform and Cloud Storage APIs, if any are not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
מתקינים את ה-SDK ומייבאים את הספריות של שיטת ההתאמה.
כוונון מפוקח (SFT)
מתקינים ומפעילים את Vertex AI SDK ל-Python, ואז מייבאים את הספריות הבאות:
import os
import time
import uuid
import vertexai
vertexai.init(project=PROJECT_ID, location=REGION)
from google.cloud import aiplatform
from vertexai.tuning import sft, SourceModel
כוונון זיקוק
מתקינים את ה-SDK הבא:
pip install google-genai
לאחר מכן מייבאים את הספריות הבאות:
import os
import time
import uuid
from google import genai
from google.genai import types
client = genai.Client(vertexai=True, project=PROJECT_ID, location=REGION)
הכנת מערך נתונים לכוונון
כדי לבצע התאמה עדינה, צריך מערך נתונים לאימון. מומלץ להכין מערך נתונים אופציונלי לאימות אם רוצים להעריך את הביצועים של המודל המכוונן.
קבוצת הנתונים צריכה להיות באחד מהפורמטים הנתמכים הבאים של JSON Lines (JSONL), כאשר כל שורה מכילה דוגמה אחת לכוונון.
מעלים את קובצי ה-JSONL ל-Cloud Storage.
מערכי נתונים עם טקסט בלבד
השלמת הפרומפט
{"prompt": "<prompt text>", "completion": "<ideal generated text>"}
פורמט צ'אט מבוסס תורות
{"messages": [
{"content": "You are a chatbot that helps with scientific literature and generates state-of-the-art abstracts from articles.",
"role": "system"},
{"content": "Summarize the paper in one paragraph.",
"role": "user"},
{"content": " Here is a one paragraph summary of the paper:\n\nThe paper describes PaLM, ...",
"role": "assistant"}
]}
GenerateContent
{
"systemInstruction": {
"parts": [{ "text": "You are a chatbot that helps with scientific literature and generates state-of-the-art abstracts from articles." }]},
"contents": [
{"role": "user",
"parts": [{ "text": "Summarize the paper in one paragraph." }]},
{"role": "assistant",
"parts": [{ "text": "Here is a one paragraph summary of the paper:\n\nThe paper describes PaLM, ..." }]}
]}
קבוצות נתונים מולטי-מודאליות
פורמט צ'אט מבוסס תורות
{"messages": [
{"role": "user", "content": [
{"type": "text", "text": "You are a chatbot that helps with scientific literature and generates state-of-the-art abstracts from articles."},
{"type": "image_url", "image_url": {
"url": "gs://your-gcs-bucket/your-image.jpeg",
"detail": "low"}}]
},
{"role": "assistant", "content": [
{"type": "text", "text": "Here is a one paragraph summary of the paper:\n\nThe paper describes PaLM, ..."}]
},
{"role": "user", "content": [
{"type": "text", "text": "You are a chatbot that helps with scientific literature and generates state-of-the-art abstracts from articles."},
{"type": "image_url", "image_url": {
"url": "data:image/jpeg;base64,<base64 image>",
"detail": "low"}}]
},
{"role": "assistant", "content": [
{"type": "text", "text": "Here is a one paragraph summary of the paper:\n\nThe paper describes PaLM, ..."}]
},
]}
GenerateContent
{
"systemInstruction": {
"parts": [{ "text": "You are a chatbot that helps with scientific literature and generates state-of-the-art abstracts from articles." }]},
"contents": [
{"role": "user",
"parts": [
{"text": "You are a chatbot that helps with scientific literature and generates state-of-the-art abstracts from articles." },
{"file_data": {
"mime_type": "image/jpeg", "file_uri": "gs://your-gcs-bucket/your-image.jpeg"}}]
},
{"role": "assistant",
"parts": [{ "text": "Here is a one paragraph summary of the paper:\n\nThe paper describes PaLM, ..." }]}
]}
הפורמטים הנתמכים הם JPEG, PNG, WEBP ותמונות בקידוד Base64.
שימו לב: אם התמונות מאוחסנות בקטגוריה אחרת ב-Cloud Storage מהקטגוריה שבה מאוחסנים קובצי ה-JSONL, צריך לוודא שהענקתם את תפקיד IAM Storage Object User (roles/storage.objectUser) בשתי הקטגוריות לשני חשבונות השירות האלה:
service-PROJECT_NUMBER@gcp-sa-vertex-moss-ft.iam.gserviceaccount.comservice-PROJECT_NUMBER@gcp-sa-aiplatform.iam.gserviceaccount.com
יצירת משימת שיפור
אפשר לכוון את הערוץ מהמקורות הבאים:
- מודל בסיס נתמך, כמו Llama 3.1
מודל עם אותה ארכיטקטורה כמו אחת מהמודלים הבסיסיים הנתמכים. יכול להיות שזה יהיה נקודת ביקורת של מודל בהתאמה אישית ממאגר כמו Hugging Face או מודל שעבר כוונון בעבר מתוך משימת כוונון בפלטפורמת הסוכנים של Gemini Enterprise. כך תוכלו להמשיך לכוונן מודל שכבר כוונן.
מסוף Cloud (בפיקוח)
אפשר להתחיל את תהליך הכוונון העדין בדרכים הבאות:
- עוברים לכרטיס המודל, לוחצים על שיפור הדיוק ובוחרים באפשרות שיפור דיוק מנוהל.
או
- עוברים לדף Tuning (כוונון) ולוחצים על Create tuned model (יצירת מודל שעבר כוונון).
ממלאים את הפרמטרים ולוחצים על התחלת ההתאמה.
פעולה זו תתחיל פעולת כוונון, שאפשר לראות בדף הכוונון בכרטיסייה Managed tuning.
אחרי שפעולת הכוונון תסתיים, תוכלו לראות את המידע על המודל המכוונן בכרטיסייה פרטים.
Agent Platform SDK (בפיקוח)
מחליפים את ערכי הפרמטרים בערכים שלכם ומריצים את הקוד הבא כדי ליצור משימת אופטימיזציה:
sft_tuning_job = sft.train(
source_model=SourceModel(
base_model="meta/llama3_1@llama-3.1-8b",
# Optional, folder that is either a custom model checkpoint or previously tuned model
custom_base_model="gs://{STORAGE-URI}",
),
tuning_mode="FULL", # FULL or PEFT_ADAPTER
epochs=3,
train_dataset="gs://{STORAGE-URI}", # JSONL file
validation_dataset="gs://{STORAGE-URI}", # JSONL file
output_uri="gs://{STORAGE-URI}",
)
GenAI SDK (זיקוק)
מחליפים את ערכי הפרמטרים בערכים משלכם ואז מריצים את הקוד הבא כדי ליצור משימת כוונון של זיקוק:
tuning_job = client.tunings.tune(
base_model="qwen/qwen3@qwen3-4b",
training_dataset=types.TuningDataset(
gcs_uri="gs://{STORAGE-URI}"
),
config=types.CreateTuningJobConfig(
method="DISTILLATION",
base_teacher_model="qwen/qwen3-next-80b-a3b-thinking-maas",
epoch_count=3,
validation_dataset=types.TuningValidationDataset(
gcs_uri="gs://{STORAGE-URI}"
),
output_uri="gs://{STORAGE-URI}",
),
)
פריטי מידע שנוצרו בתהליך פיתוח (Artifact) של מודל שעבר התאמה
כשפעולת הכוונון מסתיימת, פריטי המידע של המודל המכוונן נשמרים בספריית הפלט שלכם ב-Cloud Storage.
gs://<output_dir>/
# (Distillation tuning only) The labeled dataset from teacher model's inference
-> distillation_labelled_dataset.jsonl
gs://<output_dir>/postprocess/node-0/checkpoints/
# Final checkpoint
-> final/
-> model-00001-of-000xx.safetensors
-> model-000yy-of-000xx.safetensors
# Intermediate checkpoints
-> checkpoint-M/
-> model-00001-of-000xx.safetensors
-> model-000yy-of-000xx.safetensors
…
-> checkpoint-N/
-> model-00001-of-000xx.safetensors
-> model-000yy-of-000xx.safetensors
- אפשר לשמור עד 10 נקודות ציון.
- אם מספר האפוקים (E) קטן מ-10, נשמרים בדיוק E נקודות ביקורת (אחת לכל אפוק).
- מוזמנים צ'קפוינטים ביניים בטווח M עד N. הערה: לא תמיד יש מספור עוקב לנקודות הביניים. לדוגמה, יכול להיות שמספרי נקודות הבדיקה יהיו 1, 3, 5, 10 ולא 1, 2, 3, 4.
פריסת מודל שעבר התאמה
אפשר לפרוס את המודל שעבר התאמה לנקודת קצה של Gemini Enterprise Agent Platform. אפשר גם לייצא את המודל שעבר התאמה מ-Cloud Storage ולפרוס אותו במקום אחר.
כדי לפרוס את המודל שעבר כוונון לנקודת קצה של Gemini Enterprise Agent Platform:
Cloud Console
עוברים לדף Model Garden ולוחצים על Deploy model with custom weights (פריסת מודל עם משקלים מותאמים אישית).
ממלאים את הפרמטרים ולוחצים על פריסה.
Agent Platform SDK ל-Python
פריסה של G2 machine באמצעות קונטיינר מוכן מראש:
from vertexai.preview import model_garden
MODEL_ARTIFACTS_STORAGE_URI = "gs://{STORAGE-URI}/postprocess/node-0/checkpoints/final"
model = model_garden.CustomModel(
gcs_uri=MODEL_ARTIFACTS_STORAGE_URI,
)
# deploy the model to an endpoint using GPUs. Cost will incur for the deployment
endpoint = model.deploy(
machine_type="g2-standard-12",
accelerator_type="NVIDIA_L4",
accelerator_count=1,
)
קבלת מסקנה
אחרי שהפריסה תצליח, תוכלו לשלוח בקשות לנקודת הקצה עם הנחיות טקסט. הערה: הביצוע של הפרומפטים הראשונים יימשך זמן רב יותר.
# Loads the deployed endpoint
endpoint = aiplatform.Endpoint("projects/{PROJECT_ID}/locations/{REGION}/endpoints/{endpoint_name}")
prompt = "Summarize the following article. Article: Preparing a perfect risotto requires patience and attention to detail. Begin by heating butter in a large, heavy-bottomed pot over medium heat. Add finely chopped onions and minced garlic to the pot, and cook until they're soft and translucent, about 5 minutes. Next, add Arborio rice to the pot and cook, stirring constantly, until the grains are coated with the butter and begin to toast slightly. Pour in a splash of white wine and cook until it's absorbed. From there, gradually add hot chicken or vegetable broth to the rice, stirring frequently, until the risotto is creamy and the rice is tender with a slight bite.. Summary:"
# Define input to the prediction call
instances = [
{
"prompt": "What is a car?",
"max_tokens": 200,
"temperature": 1.0,
"top_p": 1.0,
"top_k": 1,
"raw_response": True,
},
]
# Request the prediction
response = endpoint.predict(
instances=instances
)
for prediction in response.predictions:
print(prediction)
פרטים נוספים על קבלת היקשים ממודל שפרסתם זמינים במאמר בנושא קבלת היקש אונליין.
שימו לב שבמודלים פתוחים מנוהלים נעשה שימוש בשיטה chat.completions במקום בשיטה predict שבה נעשה שימוש במודלים שפורסמו. מידע נוסף על קבלת מסקנות ממודלים מנוהלים זמין במאמר ביצוע קריאה למודל Llama.
מגבלות ומכסות
המכסה נאכפת על מספר משימות ההתאמה האישית שמתבצעות בו-זמנית. לכל פרויקט יש מכסה שמוגדרת כברירת מחדל להרצת לפחות משימת כוונון אחת. זו מכסה גלובלית, שמשותפת לכל האזורים הזמינים ולכל המודלים הנתמכים. אם רוצים להריץ יותר משימות בו-זמנית, צריך לבקש מכסה נוספת ל-Global concurrent managed OSS model fine-tuning jobs per project.
בנוסף למכסת משימות ההתאמה, לצורך התאמה מדויקת של מודל באמצעות זיקוק נדרש מודל מורה, ולכן בפרויקט שלכם צריכה להיות מכסה מספקת למודל המורה שצוין. מודלים פתוחים שמוצעים כשירות (MaaS) משתמשים במכסה משותפת דינמית. כשמריצים משימת התאמה אישית שקוראת למודל מורה, המשימה הזו צורכת מהמכסה המשותפת של הפרויקט למודל הזה. מידע נוסף על מכסות למודלים מנוהלים בקוד פתוח זמין במאמר מודלים מנוהלים של Gemini Enterprise Agent Platform ל-MaaS.
תמחור
החיוב על שיפור המודל מתבצע לפי התמחור של שיפור מודלים. מספר טוקני האימון מחושב על ידי הכפלת מספר הטוקנים במערך נתוני האימון במספר התקופות של זמן המערכת. בנוסף, כשמבצעים כוונון זיקוק, מחויבים על קריאות ה-API שבוצעו למודל המורה כדי ליצור תשובות, על סמך התמחור של מודלים מנוהלים.
בנוסף, תקבלו חיוב על שירותים קשורים, כמו Cloud Storage ו-Gemini Enterprise Agent Platform Prediction.
כדאי לעיין במחירון של Gemini Enterprise Agent Platform ובמחירון של Cloud Storage, ולהשתמש במחשבון עלויות כדי ליצור הערכת עלויות בהתאם לשימוש החזוי.