כוונון מפוקח (SFT) הוא אפשרות טובה אם יש לכם משימת תרגום עם נתוני טקסט מסומנים זמינים. השיטה הזו יעילה במיוחד ליישומים ספציפיים לתחום, שבהם התרגום שונה באופן משמעותי מהנתונים הכלליים שעליהם אומן המודל הגדול במקור.
כוונון מפוקח (SFT) משנה את התנהגות המודל באמצעות מערך נתונים עם תוויות. במהלך התהליך הזה, המערכת משנה את המשקלים של המודל כדי למזער את ההבדל בין ההסקות שלו לבין התוויות בפועל.
מודלים נתמכים
מודלים של LLM לתרגום הבאים תומכים בכוונון מונחה:
translation-llm-002
מגבלות
- מספר מקסימלי של טוקנים בקלט ובפלט:
- אזור השירות: 1,000 (~4,000 תווים)
- גודל מערך הנתונים לאימות: 1,024 דוגמאות
- גודל הקובץ של מערך הנתונים לאימון: עד 1GB ל-JSONL
- אורך דוגמה לאימון: 1,000 (~4,000 תווים)
- גודל המתאם:
-
Translation LLM V2: הערך הנתמך הוא רק 4. שימוש בערכים אחרים (לדוגמה, 1 או 8) יגרום לכשל.
-
תרחישי שימוש בכוונון מפוקח (SFT)
מודל כללי של תרגום שעבר אימון מראש מתאים לתרגום טקסט שמבוסס על מבני טקסט כלליים ונפוצים שהמודל למד מהם. אם רוצים שמודל ילמד משהו נישתי או ספציפי לדומיין שחורג מתרגום כללי, כדאי לשקול לכוונן את המודל הזה. לדוגמה, אתם יכולים להשתמש בכוונון מודל כדי ללמד את המודל את הדברים הבאים:
- תוכן ספציפי של דומיין בתחום מסוים עם ז'רגון או סגנון
- מבנים או פורמטים ספציפיים ליצירת פלט.
- התנהגויות ספציפיות, כמו מתי לספק פלט תמציתי או מפורט.
- פלט מותאם אישית ספציפי לסוגים ספציפיים של קלט.
הגדרת אזור גיאוגרפי לעבודת אופטימיזציה
נתוני המשתמשים, כמו מערך הנתונים שעבר טרנספורמציה והמודל שעבר התאמה, מאוחסנים באזור של משימת ההתאמה. האזור הנתמך היחיד הוא us-central1.
אם משתמשים ב-Vertex AI SDK, אפשר לציין את האזור בהפעלה הראשונית. לדוגמה:
import vertexai vertexai.init(project='myproject', location='us-central1')אם יוצרים משימת כוונון עדין מפוקחת על ידי שליחת בקשת POST באמצעות השיטה
tuningJobs.create, צריך להשתמש בכתובת ה-URL כדי לציין את האזור שבו משימת הכוונון תפעל. לדוגמה, בכתובת ה-URL הבאה, כדי לציין אזור צריך להחליף את שני המקרים שלTUNING_JOB_REGIONבאזור שבו מופעלת העבודה.https://TUNING_JOB_REGION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/TUNING_JOB_REGION/tuningJobsאם משתמשים בGoogle Cloud מסוף, אפשר לבחור את שם האזור בשדה הנפתח אזור בדף פרטי המודל. זה אותו הדף שבו בוחרים את מודל הבסיס ואת שם המודל המותאם.
מכסה
המכסה נאכפת על מספר משימות ההתאמה האישית שמתבצעות בו-זמנית. כל פרויקט מגיע עם מכסה שמאפשר להריץ לפחות משימת התאמה אחת. זו מכסה גלובלית שמשותפת לכל האזורים הזמינים ולכל המודלים הנתמכים. אם אתם רוצים להריץ יותר משימות בו-זמנית, אתם צריכים לבקש מכסה נוספת ל-Global concurrent tuning jobs.
תמחור
החיוב על שיפור המודל מתבצע בהתאם לתמחור של שיפור מודל התרגום.
תחויבו גם על שירותים קשורים, כמו Cloud Storage ו-Translation LLM Prediction.
מידע על התמחור של Translation LLM ו התמחור של Cloud Storage.