בדף הזה מפורטים התנאים המוקדמים וההוראות המפורטות לשיפור וליטוש של Gemini על נתוני וידאו באמצעות למידה מפוקחת.
תרחישים לדוגמה
באמצעות כוונון עדין, אתם יכולים להתאים מודלים בסיסיים של Gemini למשימות מיוחדות. הנה כמה תרחישי שימוש בווידאו:
סיכום אוטומטי של סרטונים: כוונון של מודלים גדולים של שפה (LLM) כדי ליצור סיכומים תמציתיים ועקביים של סרטונים ארוכים, שכוללים את הנושאים, האירועים והנרטיבים העיקריים. האפשרות הזו שימושית לגילוי תוכן, לארכיון ולבדיקות מהירות.
זיהוי מפורט של אירועים ולוקליזציה שלהם: כוונון עדין מאפשר למודלים של שפה גדולה לזהות ולמקם פעולות, אירועים או אובייקטים ספציפיים בציר זמן של סרטון בצורה מדויקת יותר. לדוגמה, זיהוי כל המקרים של מוצר מסוים בסרטון שיווקי או פעולה ספציפית בצילומי ספורט.
ניהול תוכן: כוונון מיוחד יכול לשפר את היכולת של מודל LLM לזהות תוכן רגיש, לא הולם או מפר מדיניות בסרטונים. המודל לא מסתמך רק על זיהוי אובייקטים פשוט, אלא גם מבין את ההקשר והניואנסים.
כתוביות לסרטונים: למרות שזו כבר אפליקציה נפוצה, כוונון יכול לשפר את הדיוק, הרהיטות והמודעות להקשר של כתוביות שנוצרות אוטומטית, כולל תיאורים של רמזים לא מילוליים.
מגבלות
- גודל קובץ הסרטון המקסימלי: 100MB.
יכול להיות שהנפח הזה לא יספיק לקובצי וידאו גדולים. הנה כמה פתרונות מומלצים:
- אם יש מעט מאוד קבצים גדולים, אפשר להשמיט אותם מקובצי ה-JSONL.
- אם יש הרבה קבצים גדולים במערך הנתונים ואי אפשר להתעלם מהם, צריך להקטין את הרזולוציה החזותית של הקבצים. הדבר עלול לפגוע בביצועים.
- מחלקים את הסרטונים לחלקים כדי להגביל את גודל הקבצים ל-100MB ומשתמשים בחלקים האלה כדי לכוונן את המודל. חשוב לשנות את כל ההערות עם חותמות הזמן שמתאימות לציר הזמן של הסרטון המקורי, כך שיתאימו לציר הזמן של הסרטון החדש (שמחולק לחלקים).
- אורך מקסימלי של סרטון לכל דוגמה: אפשר להוסיף רק סרטון אחד לכל דוגמה. היא יכולה להיות באורך של 5 דקות עם
MEDIA_RESOLUTION_HIGHאוMEDIA_RESOLUTION_MEDIUM, ו-20 דקות עםMEDIA_RESOLUTION_LOW. - דוגמאות שהוסרו: אם דוגמה מכילה סרטון שארוך יותר מהאורך המקסימלי הנתמך, הדוגמה הזו מוסרת ממערך הנתונים. לא מחויבים על דוגמאות שהמערכת פסלה, והן לא משמשות לאימון. אם יותר מ-10% ממערך הנתונים יושמטו, העבודה תיכשל ותוצג הודעת שגיאה לפני תחילת האימון.
- אין תמיכה בשילוב של רזולוציות שונות של מדיה: הערך של
mediaResolutionבכל דוגמה במערך הנתונים המלא לאימון חייב להיות עקבי. לכל השורות בקובצי ה-JSONL שמשמשים לאימון ולאימות צריך להיות אותו ערך שלmediaResolution.
פורמט מערך הנתונים
בשדה fileUri מציינים את המיקום של מערך הנתונים. זו יכולה להיות כתובת ה-URI של קובץ בקטגוריה של Cloud Storage, או כתובת URL של HTTP או HTTPS שזמינה באופן ציבורי.
השדה mediaResolution משמש לציון מספר האסימונים לכל פריים בסרטוני הקלט. בטבלה הבאה מפורטים מספר האסימונים של מודלים נתמכים:
Gemini 2.5:
MEDIA_RESOLUTION_LOW: 64 טוקנים לכל פריים
MEDIA_RESOLUTION_MEDIUMו-MEDIA_RESOLUTION_HIGH: 256 טוקנים לכל פריים
התאמת מודלים באמצעות
MEDIA_RESOLUTION_LOWמהירה פי 4 בערך מהתאמת מודלים באמצעותMEDIA_RESOLUTION_MEDIUMאוMEDIA_RESOLUTION_HIGH, עם שיפור מינימלי בביצועים.Gemini 3:
מספר הטוקנים זהה למספר הטוקנים של מודל הבסיס. מידע נוסף זמין במאמר בנושא רזולוציית מדיה.
כשמשתמשים בקטע וידאו לאימון ולתיקוף, קטע הווידאו מופיע בשדה videoMetadata. במהלך ההתאמה, נקודת הנתונים הזו מפוענחת כך שתכיל מידע מהפלח שחולץ מקובץ הווידאו שצוין, החל מחותמת הזמן startOffset (ההיסט של ההתחלה, בשניות) ועד endOffset.
כדי לראות דוגמה לפורמט כללי, אפשר לעיין בדוגמה של מערך נתונים ל-Gemini.
בקטעים הבאים מוצגות דוגמאות לפורמטים של מערכי נתונים של סרטונים.
דוגמה לסכימת JSON למקרים שבהם הסרטון המלא משמש לאימון ולאימות
הסכימה הזו מתווספת כשורה אחת בקובץ JSONL.
{
"contents": [
{
"role": "user",
"parts": [
{
"fileData": {
"fileUri": "gs://<path to the mp4 video file>",
"mimeType": "video/mp4"
},
},
{
"text": "
You are a video analysis expert. Detect which animal appears in the
video.The video can only have one of the following animals: dog, cat,
rabbit.\n Output Format:\n Generate output in the following JSON
format:\n
[{\n
\"animal_name\": \"<CATEGORY>\",\n
}]\n"
}
]
},
{
"role": "model",
"parts": [
{
"text": "```json\n[{\"animal_name\": \"dog\"}]\n```"
}
]
},
],
"generationConfig": {
"mediaResolution": "MEDIA_RESOLUTION_LOW"
}
}
(רק בדגמי Gemini 3 ומעלה) החל מדגמי Gemini 3, אפשר גם להגדיר את רזולוציית המדיה לכל פריט מדיה בנפרד Part. כך אפשר לשלב רזולוציות שונות במערך הנתונים (לדוגמה, להגדיר MEDIA_RESOLUTION_HIGH לפריט אחד ו-MEDIA_RESOLUTION_LOW לפריט אחר). למידע נוסף על רזולוציה ברמת החלק ועל מספר הטוקנים התואם, אפשר לעיין במאמר בנושא רזולוציית מדיה.
הגדרות רזולוציית המדיה ברמה Part מקבלות עדיפות על פני הגדרות גלובליות.
זוהי דוגמה למערך נתונים שבו הרזולוציה של המדיה מוגדרת ברמה הגלובלית וברמת Part:
{
"contents": [
{
"role": "user",
"parts": [
{
"fileData": {
"fileUri": "gs://<path to the mp4 video file>",
"mimeType": "video/mp4"
}
},
{
"fileData": {
"fileUri": "gs://<path to the mp4 video file>",
"mimeType": "video/mp4"
},
"mediaResolution": {
"level": "MEDIA_RESOLUTION_HIGH"
}
},
{
"text": "Describe these videos in detail."
}
]
},
{
"role": "model",
"parts": [
{
"text": "Video 1 is low resolution while video 2 is sharp and clear"
}
]
}
],
"generationConfig": {
"mediaResolution": "MEDIA_RESOLUTION_LOW"
}
}
דוגמה לסכימת JSON למקרים שבהם נעשה שימוש בקטע וידאו לצורך אימון ואימות
הסכימה הזו מתווספת כשורה אחת בקובץ JSONL.
{
"contents": [
{
"role": "user",
"parts": [
{
"fileData": {
"fileUri": "gs://<path to the mp4 video file>",
"mimeType": "video/mp4"
},
"videoMetadata": {
"startOffset": "5s",
"endOffset": "25s"
}
},
{
"text": "
You are a video analysis expert. Detect which animal appears in the
video.The video can only have one of the following animals: dog, cat,
rabbit.\n Output Format:\n Generate output in the following JSON
format:\n
[{\n
\"animal_name\": \"<CATEGORY>\",\n
}]\n"
}
]
},
{
"role": "model",
"parts": [
{
"text": "```json\n[{\"animal_name\": \"dog\"}]\n```"
}
]
},
],
"generationConfig": {
"mediaResolution": "MEDIA_RESOLUTION_LOW"
}
}
המאמרים הבאים
מידע נוסף על שיפור סרטונים זמין במאמר איך משפרים את Gemini 2.5 באמצעות סרטונים דרך Agent Platform.
מידע נוסף על יכולת הבנת התמונות של Gemini זמין במסמכי התיעוד בנושא הבנת תמונות.
כדי להתחיל בתהליך ההתאמה, אפשר לעיין במאמר התאמה של מודלים של Gemini באמצעות כוונון עדין מפוקח
כדי ללמוד איך אפשר להשתמש בכוונון מפוקח (SFT) בפתרון שיוצר מאגר ידע של AI גנרטיבי, אפשר לעיין במאמר פתרון התחלתי: מאגר ידע של AI גנרטיבי.